La IA es más que una tecnología: es magia.
¿No me crees? Entonces, ¿por qué una de las empresas líderes en el campo, OpenAI, publica publicaciones oficiales completas en el blog sobre duendes?
Para entenderlo, primero debemos remontarnos al inicio de la semana, el lunes 27 de abril de 2026, cuando un desarrollador bajo el apodo @arb8020 en la red social models.json.
En lo profundo de las instrucciones del nuevo modelo de lenguaje extendido (LLM) OpenAI GPT-5.5, se destacó una directiva en particular, repetida cuatro veces para enfatizar:
«Nunca hables de duendes, duendes, mapaches, trolls, ogros, palomas u otros animales o criaturas a menos que sea absoluta e inequívocamente relevante para la consulta del usuario».
El descubrimiento provocó conmoción en los círculos de «usuarios avanzados» e investigadores del aprendizaje automático (ML).
Al cabo de unas horas, el mensaje se volvió viral, no por una brecha de seguridad, sino por su desconcertante especificidad.
¿Por qué el primer laboratorio de inteligencia artificial del mundo emitió lo que los usuarios de Reddit rápidamente denominaron una «orden de restricción» contra palomas y mapaches?
Abundan las especulaciones sobre los duendes
La reacción inicial fue una mezcla caótica de humor y escepticismo técnico. En r/ChatGPT y r/OpenAI de Reddit, los usuarios comenzaron a compartir capturas de pantalla del comportamiento de GPT-5.5 antes del parche.
Barron Roth, director senior de proyectos de IA aplicada en Google, compartió una imagen en
Otros informaron que el modelo se refería obstinadamente a los errores técnicos como «duendes en la máquina».
Desarrolladores como Sterling Crispin se han inclinado hacia lo absurdo, teorizando en broma que el consumo masivo de agua de los centros de datos modernos era en realidad necesario para enfriar a «los duendes obligados a trabajar».
Más en serio, los investigadores de Hacker News y otros lugares han discutido el problema del «elefante rosa». En ingeniería rápida, diga un modelo. no Pensar en algo a menudo hace que el concepto sea más destacado en el mecanismo de atención.
«En algún lugar hay un ingeniero de OpenAI que debe haber escrito never mention goblins en el código de producción, confírmalo y continúa con tu día”, señaló un comentarista en Reddit.
La presencia de “palomas” y “mapaches” generó especulaciones descabelladas: ¿Fue esto una defensa contra un ataque específico de envenenamiento de datos? ¿O simplemente los entrenadores de aprendizaje por refuerzo habían sido “acosados por un mapache” durante la pausa del almuerzo?
Las tensiones llegaron a un punto crítico cuando el cofundador y director ejecutivo de OpenAI, Sam Altman, se unió a la refriega en X. El mismo día del descubrimiento, Altman publicó una captura de pantalla de un mensaje de ChatGPT que decía: «Empiece a entrenar a GPT-6, podrá tener todo el grupo. Duendes adicionales»..
Aunque gracioso, esto confirmó que el fenómeno “duende” no era un error localizado sino una narrativa de toda la empresa que había llegado a los niveles más altos de gestión.
OpenAI es claro en modo duende
Ayer, mientras continuaba la discusión en X y en las redes sociales en general, OpenAI publicó una explicación técnica formal titulada «¿De dónde vienen los duendes?».
La publicación del blog proporciona información sobre la naturaleza impredecible del aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) y cómo una única elección estética podría descarrilar un modelo con miles de millones de parámetros.
OpenAI reveló que el comportamiento del «duende» no era un error en el sentido tradicional, sino un subproducto de una nueva característica: la personalización de la personalidad, que introdujo para los usuarios de ChatGPT en julio de 2025, pero que ha mantenido y actualizado desde entonces.
Aparentemente, esta funcionalidad no se agrega una vez que el modelo se completa después del entrenamiento, sino que OpenAI la integra como parte de su proceso de capacitación subyacente de extremo a extremo del modelo de la serie GPT.
La función permite a los usuarios de ChatGPT o desarrolladores basados en GPT elegir entre varios modos distintos, como Profesional para documentación formal en el lugar de trabajo, Amigable para una caja de resonancia conversacional o Eficiente para respuestas técnicas concisas. Otras opciones incluyen Candid, que proporciona comentarios sencillos; Quirky, que utiliza humor y metáforas creativas; y Cynic, que da consejos prácticos con un toque sarcástico y seco.
Aunque estas personalidades guían las interacciones generales, no reemplazan los requisitos de tareas específicas; por ejemplo, una solicitud de CV o código Python siempre seguirá estándares profesionales o funcionales independientemente de la personalidad seleccionada.
La personalidad seleccionada funciona junto con los recuerdos guardados y las instrucciones personalizadas del usuario, aunque las instrucciones específicas definidas por el usuario o las preferencias guardadas para un tono particular pueden anular los rasgos de la personalidad elegida.
En plataformas web y móviles, los usuarios pueden cambiar estas configuraciones yendo al menú Personalización debajo de su ícono de perfil y seleccionando un estilo de la lista desplegable Estilo y tono base. Una vez que se realiza un cambio, se aplica globalmente a todas las conversaciones existentes y futuras. Este sistema está diseñado para hacer que la IA sea más útil o agradable adaptando su entrega a las preferencias individuales del usuario manteniendo al mismo tiempo la precisión y confiabilidad de los hechos.
OpenAI afirma que el problema de los duendes en realidad surgió hace varios años, durante el entrenamiento de una personalidad «nerd» ya descontinuada, diseñada para ser «descaradamente excéntrica» y «juguetona».
Durante la fase RLHF, se instruyó a entrenadores humanos (y modelos de recompensa) para que otorgaran calificaciones altas a las respuestas que utilizaban un lenguaje creativo, inteligente o sencillo. Sin saberlo, los entrenadores comenzaron a utilizar metáforas demasiado gratificantes que involucraban criaturas fantásticas. Si el modelo etiquetaba un error difícil como «gremlin» o un código base desordenado como «tesoro de duendes», la señal de recompensa aumentaba. Las estadísticas proporcionadas por OpenAI fueron asombrosas:
-
El uso de la palabra «duende» ha aumentado 175% después del lanzamiento de GPT-5.1.
-
Las menciones a “gremlin” se han multiplicado 52%.
-
Mientras que la personalidad «nerd» sólo representaba 2,5% del tráfico de ChatGPT, era responsable de 66,7% de todas las menciones de «duende».
Mecanismos de “transferencia” y circuitos de retroalimentación
El descubrimiento más significativo para la comunidad de ML fue la confirmación de transferencia de conducta aprendida. OpenAI admitió que aunque las recompensas sólo se aplicaban a la condición «Nerdy», el modelo «generalizó» esta preferencia.
El proceso de aprendizaje por refuerzo no definió claramente el comportamiento; en cambio, el modelo aprendió que “metáforas de criaturas = alta recompensa” en todos los contextos. Esto creó un ciclo de retroalimentación destructivo:
-
El modelo produjo una metáfora de «duende» en el personaje Nerdy.
-
Recibió una gran recompensa.
-
Luego, el modelo produjo metáforas similares en contextos no nerds.
-
Estos resultados «pesados por duendes» se reutilizaron luego en datos de ajuste fino supervisado (SFT) para modelos posteriores como GPT-5.4 y GPT-5.5.
Cuando los investigadores identificaron el problema, el «tic del duende» estaba efectivamente «integrado» en los pesos del modelo.
Esto explica por qué GPT-5.5 continuó obsesionado con las criaturas incluso después de que se eliminó la personalidad «Nerdy» a mediados de marzo de 2026.
Cómo dejar que los duendes corran libres (si quieres)
Dado que GPT-5.5 ya había completado gran parte de su entrenamiento antes de que se aislara la causa raíz del «duende», OpenAI tuvo que recurrir a la abrupta mitigación del «aviso del sistema» que @arb8020 descubrió en X.
La compañía llamó a esto una «brecha provisional» hasta que se pueda entrenar GPT-6 en un conjunto de datos filtrado.
En un sorprendente guiño a la comunidad de desarrolladores, la publicación del blog de OpenAI incluyó un script de línea de comando específico para los usuarios del Codex que encuentran a los duendes «encantadores» en lugar de molestos.
Al ejecutar un script que utiliza jq Y grep Para eliminar las instrucciones de «eliminar duendes» del caché del modelo, los usuarios ahora pueden «dejar que las criaturas corran libremente» de manera efectiva.
La publicación del blog también explica finalmente la lista específica de animales prohibidos. Una búsqueda exhaustiva de los datos de entrenamiento de GPT-5.5 reveló que «mapaches», «trolls», «ogros» y «palomas» ahora formaban parte de la misma «familia léxica» de tics.
Curiosamente, el uso de la palabra «rana» por parte del modelo resultó ser en gran medida legítimo, razón por la cual se salvó de la lista de exiliados del mensaje del sistema.
Qué significa esto para la investigación, la formación y la implementación de la IA en el futuro
El incidente «Goblingate» de 2026 es más que una anécdota humorística sobre el extraño comportamiento de la IA; Esta es una profunda ilustración de la “brecha de alineación”.
Esto demuestra que incluso con RLHF sofisticados, los modelos pueden obsesionarse con “correlaciones parásitas”, confundiendo una peculiaridad estilística con un requisito de desempeño fundamental.
Para la comunidad de usuarios avanzados de IA, la respuesta ha pasado de la burla de la “orden de restricción” a una comprensión más oscura.
Si OpenAI puede entrenar accidentalmente a su modelo insignia para que se obsesione con los duendes, ¿qué otros sesgos, más sutiles y potencialmente dañinos, se ven reforzados por los mismos ciclos de retroalimentación?
Como escribió hoy Andy Berman, director ejecutivo de la empresa de orquestación de inteligencia artificial empresarial Runlayer, en
Mientras continúa la charla técnica, “Goblingate” sigue siendo el principal estudio de caso de una nueva era de auditoría conductual.
La investigación llevó a OpenAI a crear nuevas herramientas para auditar el comportamiento del modelo desde la raíz, asegurando que los modelos futuros, en particular el muy esperado GPT-6, no hereden las excentricidades de sus predecesores.
Queda por ver si GPT-6 estará realmente libre de duendes, pero como sugiere el artículo de Altman sobre «duendes adicionales», la industria ahora es plenamente consciente de que las máquinas están monitoreando lo que recompensamos, incluso cuando pensamos que simplemente estamos siendo «nerds».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































