Shopify creó un proxy LLM que brinda a cada ingeniero acceso a múltiples proveedores de IA, con conmutación por error automática cuando alguno de ellos deja de funcionar, cambia o desaparece. Cuando Claude Fable 5 cerróLos ingenieros de Shopify no entraron en pánico. El proxy los cambió a Claude Opus o GPT 5.5 automáticamente, sin interrumpir sus flujos de trabajo. «Fable se ve increíble; lo usamos, por supuesto», Farhan Thawar, jefe de ingeniería de Shopify, dice en un nuevo podcast de VentureBeat Beyond the Pilot. «Cuando un modelo aparece y luego desaparece, o puede ser tan inofensivo como una actualización, el proxy nos permite distribuir entre los diferentes proveedores», afirma Thawar.
Shopify compra tokens al por mayor y todos los usuarios se conectan a los modelos a través de su proxy, dice Thawar. Esto le da a su equipo acceso a informes y conmutación por error; cuando hay un problema de disponibilidad con un proveedor, los usuarios pueden ser transferidos «automáticamente y sin problemas» a otro. Las empresas pueden aprender de este ejemplo y considerar cómo una disrupción podría afectar sus negocios, afirma Thawar. Como mínimo, deberían establecer un plan de respaldo sólido. Es importante tener un sistema que permita el movimiento entre modelos para que las empresas no estén «supervinculadas» a un proveedor específico. La destilación es otra estrategia importante. Con la destilación, un modelo de estudiante aprende de un modelo de maestro y normalmente se especializa en una tarea más específica. Estos modelos de lenguaje pequeño (SLM) pueden ser más beneficiosos que los modelos generalizados disponibles en algunas circunstancias. Por ejemplo, el asistente de inteligencia artificial insignia de Shopify, Sidekick, que realiza numerosas subtareas especializadas para que los comerciantes puedan «eliminar el trabajo duro» de su día a día. Utilizar modelos destilados más pequeños puede ser más rápido y económico que modelos más generalizados, afirma Thawar. En algunos casos, han demostrado ser dos veces más baratos y rápidos; en casos más extremos, 30 veces más barato y más rápido, afirma. Pero «no se trata sólo de costo y latencia, que son importantes; se trata de precisión», dice Thawar. Los ingenieros alimentan al UDP con su modelo de maestro, datos de entrenamiento, evaluaciones y un modelo de destino; digamos, Opus 4.8 destilado hasta Qwen 3.5. La canalización dura aproximadamente un día y luego devuelve una evaluación que muestra lo que realmente logró el modelo ajustado en cuanto a velocidad, costo y precisión para esa subtarea. Si la compensación parece buena, el ingeniero la implementa, sin necesidad de proceso de aprobación. La plataforma interna de Shopify, Tangle, permite a cualquiera visualizar el proceso mientras se ejecuta. Thawar dice que su “sueño” es no darle al oleoducto de destilación ningún modelo objetivo. En cambio, los usuarios podrían proporcionar al modelo del profesor datos y evaluaciones y la directiva: «En función de lo aprendido a lo largo del tiempo, quiero que mires una clase diferente de modelo, diferentes tamaños, diferentes tipos, y me digas cuál es el objetivo de destilación correcto». «Tal vez nos sorprendamos. Tal vez sea un modelo tan pequeño que pueda funcionar en un teléfono», dice Thawar. “Otras veces, tal vez regresa y dice: ‘No hay manera de resumir esto en algo mejor que lo que tenemos en la frontera’”.
Pasar de la «reflexividad de la IA» al «apalancamiento de la IA»
Los usuarios de Shopify pueden aplicar cualquier arnés que quieran: Claude Code, Codex, Cursor, GitHub Copilot para VS Code. «Exponemos a todos los diferentes arneses para que puedan tener una idea de lo que puede funcionar o no en su flujo de trabajo». Pero la empresa también implementó un panel de uso; Esto permite al equipo de Thawar hacer preguntas interesantes no solo sobre el gasto de tokens, sino también: ¿Quién usa los tokens más caros? ¿Quién dedica más tiempo al razonamiento? ¿Qué tipos de modelos se utilizan y en qué disciplinas y niveles? En cuanto al «tokenmaxxing«, Shopify tiene «disyuntores» instalados. Si un usuario tiene un modelo funcionando durante mucho tiempo (digamos, 10 horas) y consume muchos tokens, se le preguntará: «¿Querías gastar esto?» Como explica Thawar, a veces la respuesta es «Oh, absolutamente». Otras veces es: ‘Vaya, no sabía que eso se estaba ejecutando en segundo plano’. Lo olvidé por completo. Prefiero detenerlo ahora. El objetivo final, como lo describe Thawar, es pasar de la “reflexividad de la IA” al “apalancamiento de la IA” y lograr que las personas realmente piensen profundamente sobre dónde pueden beneficiarse más de la IA en sus flujos de trabajo. Escuche el podcast completo para saber más sobre:
-
La filosofía de Shopify de construir infraestructura antes que funciones. Como dice Thawar: «Siempre hemos construido más infraestructura. Continuaremos siempre construyendo más infraestructura».
-
Cómo River, el agente interno de inteligencia artificial de Shopify, crea un «sustrato de información» en toda la empresa.
-
Cómo el agente OpenClaw de Thawar descubrió que estaba viajando según su calendario y qué le dijo ese momento sobre hacia dónde se dirigen realmente los agentes.
También puedes escuchar y suscribirte Más allá del piloto en Spotify, Manzana o dondequiera que obtengas tus podcasts.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































