Runway pasó semanas intentando corregir un error persistente: los avatares generados por IA estaban descentrados durante la generación de video en tiempo real. La solución no fue una solución de back-end, sino una nueva característica de front-end que simplemente solucionó el problema. Ese es el tipo de lección que Ryan Phillips, gerente de productos empresariales de Runway ML, tomó en VB Transform 2026, diciendo que incluso las empresas que no construyen modelos básicos por sí mismas pueden aprender de cómo Runway los construye, evalúa y envía.
«Creo que incluso si no todos construyen modelos ustedes mismos, es útil aprender cómo lo hacemos, porque creo que casi todas las lecciones son aplicables a lo que todos hacen a diario», dijo Phillips.
Runway es una empresa de investigación de inteligencia artificial aplicada que crea modelos mundiales generales para impulsar herramientas generativas. Durante su presentación, Phillips demostró Runway Characters, un modelo de video en tiempo real que permite interacciones de ida y vuelta sin latencia con avatares generados por IA. Hace cinco años, crear un vídeo con texto ilegible y baja velocidad de fotogramas les llevaba a los artistas cientos de horas uniendo fotogramas individuales, dijo. Hoy en día, los modelos Runway generan vídeos interactivos sobre la marcha.
«Estudiar cómo construimos estos modelos en tiempo real puede inspirar cómo crear e implementar experiencias en tiempo real, basadas y sin agentes en sus empresas hoy», dijo.
Evaluaciones desmitificadoras
La creación de un producto de IA sólido comienza con un conjunto de evaluaciones de alta calidad. Sin embargo, la creación de este conjunto no puede considerarse únicamente una tarea de ingeniería. Esto requiere una profunda alineación multifuncional entre producto, diseño, investigación y ventas para definir cómo es realmente la “calidad”.
Phillips puso énfasis en organizar talleres internos donde los miembros del equipo revisan juntos los ejemplos generados. El objetivo es alinear a toda la organización en modos de falla específicos para que todos compartan una definición unificada de una generación exitosa.
«Pasamos mucho tiempo trabajando con nuestro equipo, analizando ejemplos… de cómo son el éxito y el fracaso, hasta los detalles más, muy detallados y quisquillosos», dijo Phillips.
El conjunto de evaluación resultante debe cubrir casos de uso amplios de clientes, así como casos extremos. Por ejemplo, Phillips señaló que para garantizar que el modelo se comportara de manera predecible cuando se lo empujaba más allá de las estructuras faciales humanas estándar, utilizaron «Diente», un personaje no humano sin nariz y con dientes muy inusuales.
Al evaluar estas generaciones, el equipo de Runway busca artefactos sutiles. En un ejemplo, un vídeo en el que el rostro de un personaje permanecía intacto pero los elementos del fondo, como una red, comenzaban a transformarse, se consideró estrictamente un fracaso.
A pesar de la naturaleza innovadora del producto, la herramienta que utiliza Runway para realizar un seguimiento de estas reseñas es simple: una hoja de cálculo de Excel. El equipo registra las pruebas diariamente y clasifica los resultados como fallas «menores» o «importantes» frente a una tasa de éxito predeterminada.
“Antes de comenzar, establecimos un listón sobre qué porcentaje debemos superar y, cuando lo alcanzamos, enviamos el modelo”, dijo Phillips. «Así que no es magia».
Para los desarrolladores empresariales que enfrentan una deriva de calidad no determinista en sus propios procesos en tiempo real, la evaluación manual a escala es un cuello de botella. Para resolver este problema, Phillips señaló que los desarrolladores pueden confiar en modelos de lenguaje para automatizar el proceso de evaluación visual.
«Los LLM son cada vez mejores a la hora de juzgar gran parte de este contenido, en particular los tipos de transformación o cambio que se verían en un conjunto de evaluación», dijo. Los equipos también pueden alimentar el contexto de LLM detrás de escena (por ejemplo, un boceto dibujado a mano o el diseño estructural de un anuncio) para guiar los procesos de generación y validación, garantizando la calidad sin agregar carga cognitiva al usuario final.
Entrenamiento de modelos y conversión de errores en características
Ofrecer vídeo generativo en tiempo real requiere una pila técnica altamente optimizada. El proceso comienza con el entrenamiento previo de un modelo base masivo, que requiere muchos recursos y es lento para generar resultados. Para lograr latencia en tiempo real, Runway se basa en la destilación, donde se entrena un modelo de «estudiante» más pequeño y más rápido para imitar el modelo de «maestro» grande. Según Phillips, la destilación ayuda a Runway a reducir «entre un 80 y un 90 por ciento del tiempo de generación».
Luego, el equipo aplica un posentrenamiento adversario (APT) al modelo destilado. Esta técnica obliga al modelo a mejorar continuamente probándolo con un sistema diseñado para encontrar sus defectos, ayudando a recuperar la agudeza visual perdida durante el proceso de destilación.
Sin embargo, cambiar la arquitectura del modelo introduce nuevos problemas. Las fases de destilación y APT introdujeron un error persistente: los personajes se balanceaban o se alejaban del centro de la imagen durante la generación en tiempo real.
El equipo pasó semanas intentando corregir el modelo básico para eliminar la deriva, dijo. Finalmente, descubrieron que si la imagen inicial del usuario estaba perfectamente centrada, el vídeo generado permanecía estable. En lugar de dedicar más tiempo a una solución de ingeniería de back-end, Runway recurrió a una solución de experiencia de usuario.
«Lo que hicimos fue que cuando notamos eso en nuestras revisiones, dijimos: ‘¿Qué pasaría si simplemente ofreciéramos esto como una característica?’ » Si un usuario nos da un personaje mirando hacia la izquierda, sabemos que el video se transformará. Arreglemoslo por ellos”, dijo Phillips.
Introdujeron una función de interfaz llamada «Optimizar la calidad de la imagen», que vuelve a centrar automáticamente la imagen del usuario antes de que comience la generación. Al encapsular una limitación del modelo backend en una herramienta frontend, los usuarios percibieron una característica útil en lugar de un defecto de ingeniería.
“Transforme las limitaciones del modelo en características del producto para poder ampliar el funcionamiento del modelo”, aconsejó Phillips. «Esto puede parecer una limitación interna, pero sus clientes no lo verán así si lo incorpora como una característica del producto».
El diablo está en los detalles de la infraestructura
La distribución global de vídeo a 24 fotogramas por segundo requiere optimizar cada capa de la infraestructura. Esto abarca desde el almacenamiento en caché y la decodificación paralela hasta realizar modificaciones profundas del kernel en asociación con proveedores de hardware como Nvidia.
Poco después de lanzar Runway Characters, dijo que el equipo notó que el 8% de las llamadas API caían a 16 fotogramas por segundo, lo que provocaba que el vídeo tartamudeara para los clientes.
Encontrar la causa raíz requirió una observación cuidadosa. El equipo utilizó un agente de inteligencia artificial impulsado por Claude junto con herramientas de monitoreo como Datadog y Sentry para rastrear la anomalía. La sesión de depuración aisló el problema en un único centro de datos en la región us-east-1.
“De hecho, la solución no fue [to] «Vaya a arreglar cualquier cosa o cambie una configuración», explicó Phillips. «De hecho, fueron y reemplazaron físicamente esas GPU en el centro de datos para solucionarlo, y eso finalmente solucionó los problemas».
Para los equipos empresariales que implementan aplicaciones en tiempo real, la conclusión es clara: las anomalías de hardware e infraestructura afectarán directamente el rendimiento del modelo, lo que requerirá capacidades de depuración rigurosas y completas.
«No olvide todos los pequeños detalles, porque hay muchísimos cuando implementa estos modelos», dijo Phillips.
Sobrevivir al “infierno del fracaso” y el futuro de la construcción mundial
El desarrollo de sistemas de IA rara vez es un proceso lineal. Los equipos a menudo se encuentran atrapados durante semanas en un solo problema sin un final a la vista, una fase que Phillips llama «el infierno del fracaso».
«Creemos que hay que pasar por ese dolor y realmente luchar un poco con el problema antes de poder lograr un gran avance», dijo. La iteración constante eventualmente aplana la curva de dificultad, lo que desencadena mejoras repentinas y exponenciales.
A medida que los modelos subyacentes superan estos obstáculos técnicos, el papel de los creativos en los negocios también está cambiando fundamentalmente. Tradicionalmente, los equipos de marketing y diseño se centran en crear activos únicos, como un anuncio o una ilustración específicos. En la era de la generación en tiempo real y los flujos de trabajo de los agentes, este paradigma está cambiando hacia la definición de parámetros, estética y propiedad intelectual.
«Es posible que no se diseñe un solo anuncio, pero se puede diseñar un mundo a partir del cual el agente o un modelo de video en tiempo real pueda generar anuncios», dijo Phillips.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































