Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |
Un equipo de seguridad que aprueba hoy un modelo de código abierto para producción comienza con una página de repositorio. La página enumera el nombre del modelo, la licencia y una etiqueta que identifica el modelo base del que desciende. Esa etiqueta es una cadena que escribió la persona que subió el archivo. Hugging Face no requiere que quienes suben videos fundamenten el reclamo mediante un análisis de nivel de peso.
El Informe ATOMpublicado por Nathan Lambert y Florian Brand en Interconnects AI en abril de 2026, rastreó aproximadamente 1.500 modelos abiertos principales. ATOM identifica derivados a través de la etiqueta base_model de Hugging Face, un campo que completa el usuario, filtrando a los modelos cuyo modelo base aparece en la lista rastreada y que tienen más de cinco descargas de por vida y excluyendo las recargas de GGUF y MLX. Por esa medida, Qwen de Alibaba La familia es la matriz declarada del 69% de los nuevos derivados de modelo abierto en febrero de 2026, frente al 1% en enero de 2024. Los laboratorios chinos en general representan el 70%. Europa se sitúa en el 4%. Las descargas acumuladas rastreadas en las tres regiones alcanzaron los 2.040 millones hasta marzo de 2026.
La brecha de verificación se extiende a la cobertura de escaneo. IA de la Fundación Cisco escanea cada archivo público subido a Hugging Face a través de un motor ClamAV actualizado, y la plataforma muestra una insignia a nivel de archivo por archivo. Abrazando el propio rostro documentación de escaneo de malware observa que un archivo que no tiene una insignia de ok ni de infectado puede estar en cola, aún analizando o tener errores. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición, no un atributo que cualquiera pueda leer antes de aprobar un modelo.
De la línea de comando a la búsqueda pública
Cisco publicó el jueves el Explorador de procedencia de la cadena de suministro de IAuna base de datos pública gratuita que cubre casi 900 modelos abiertos. Cada entrada puede contener la sede del proveedor, un gráfico de linaje con huellas dactilares, restricciones de licencia y un recuento de archivos escaneados. La herramienta amplía la experiencia de Cisco. Kit de procedencia del modeloun conjunto de herramientas Python de código abierto lanzado en abril que tomó huellas dactilares de aproximadamente 150 modelos base en más de 45 familias y más de 20 editores. La cobertura se multiplicó aproximadamente por seis en un trimestre.
La versión de abril fue una herramienta de línea de comandos. Ejecutarlo significó un entorno Python local, descargar pesos de modelo que alcanzan decenas de gigabytes y dedicar horas de ingeniero por modelo. El Explorador consulta los resultados que Cisco ya calculó. El jueves, la verificación de la paternidad comienza con una barra de búsqueda, y el costo es la razón por la que las empresas ejecutan pesas abiertas en primer lugar.
Amy Chang, jefa de Inteligencia de Amenazas de IA e Investigación de Seguridad en Cisco, ha estado argumentando por qué las brechas de verificación son importantes. durante un Panel de seguridad agente VB Transform 2026Chang presentó los resultados de 6.986 ataques de múltiples turnos contra 15 modelos emblemáticos, con tasas de éxito que alcanzaron el 88,3%. «Si no comprende cómo los modelos son susceptibles a diferentes tipos de ataques, entonces no podrá explicar cómo ese modelo que está impulsando a su agente, que está impulsando su aplicación, para comprender dónde están esos puntos de falla», dijo Chang a la audiencia. Comprender los puntos de falla comienza con saber qué modelo está ejecutando.
Explorer también muestra datos que Cisco ya utiliza operativamente. la empresa sistema cerbero inspecciona los modelos que ingresan a Hugging Face y alimenta políticas de acceso seguro que bloquean por licencia riesgosa o región de origen. Explorer hace que esa clase de información sea gratuita y se pueda buscar sin un producto de Cisco.
Cómo las huellas dactilares reemplazan la etiqueta
El Explorador basa las relaciones del modelo en puntuaciones de similitud en lugar de metadatos autoinformados. El kit de procedencia del modelo de Cisco funciona en dos etapas puntuadas. La primera etapa compara los metadatos de la arquitectura antes de cargar cualquier peso. Cuando los metadatos son ambiguos, la etapa dos extrae cinco señales de nivel de peso. Embedding Anchor Similarity captura relaciones geométricas que sobreviven al ajuste fino. La incorporación de distribución de normas codifica patrones de frecuencia de palabras. Norm Layer Fingerprint lee capas estables a través del ajuste fino. Layer Energy Profile compara distribuciones en toda la profundidad de la red. El coseno de valor de peso compara directamente los valores de peso y los modelos entrenados de forma independiente muestran una correlación esencialmente cero en esta señal. Cisco informó Precisión del 96,4 % en su propio punto de referencia de 111 pares en un umbral de 0,70, con un F1 de 0,963. Se clasificaron erróneamente cuatro pares, y todos implicaron una transformación arquitectónica extrema que Cisco llama un límite fundamental de la comparación de pesos por pares.
Las señales del tokenizador se calculan para el diagnóstico, pero se excluyen deliberadamente de la puntuación de procedencia. StableLM y Pythia usan el tokenizador GPT-NeoX y calificarían como relacionados a pesar de no compartir linaje de peso. La exclusión de los datos del tokenizador evita falsos positivos.
La toma de huellas dactilares del comportamiento añade un segundo enfoque. Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la UIUC, publicaron un trabajo sobre estabilidad del criterio de valoración del comportamiento mostrando que un punto final del modelo puede mantenerse saludable mientras su identidad efectiva cambia a través de actualizaciones de peso, cuantificación o enrutamiento. El blog de lanzamiento de Cisco afirma que Explorer integra huellas dactilares estáticas y análisis de similitud de comportamiento para fundamentar el gráfico de linaje. El análisis estático proporciona evidencia a nivel de peso de la derivación del tiempo de entrenamiento. El análisis de comportamiento detecta la deriva de identidad en tiempo de ejecución.
Donde las herramientas existentes se quedan cortas
El Explorer tiene límites reales. Casi 900 modelos es un comienzo significativo, pero Hugging Face presenta más de 2 millones a partir de la primavera de 2026. Los modelos fuera del límite aún dependen de la etiqueta autoinformada. Cisco no ha dicho si Explorer expone una API y, sin una, un equipo puede buscar modelos a mano pero no puede conectar el cheque a una puerta de CI. Ésa es la línea entre un artefacto de gobernanza y un control.
Las herramientas SCA tradicionales enfrentan una discrepancia estructural porque fueron creadas para manifiestos de dependencia e imágenes de contenedores. Sakshi Grover, director senior de investigación de ciberseguridad de IDC, dijo en OSC en línea que la SCA tradicional «fue diseñada para inspeccionar manifiestos de dependencia, bibliotecas e imágenes de contenedores» y «es mucho menos eficaz para identificar» los riesgos vinculados a los flujos de trabajo de IA. Jaishiv Prakash, analista director de Gartner, dijo al mismo medio que las empresas necesitan «controles dedicados para las fuentes del modelo, las versiones aprobadas, el acceso y la validación del tiempo de ejecución en la capa de registro». Ambos comentaban sobre riesgos más amplios de la cadena de suministro, pero la brecha que describen es la que apunta el Explorer.
Cisco Modelo Procedencia Constitución define dónde un modelo cuenta como derivado de otro. La constitución por defecto etiqueta los pares ambiguos como independientes, porque un falso positivo desencadena una acusación de licencia, mientras que un falso negativo queda atrapado durante la revisión manual. Ese conservadurismo deliberado respalda la cifra de precisión del 96,4%. La derivación no es binaria y la toma de huellas dactilares es una forma de evidencia junto con la documentación y la verificación de puntos de control.
Qué va en el registro de aprobación
El 2 de agosto, la Comisión Europea obtiene su Poderes de aplicación de la Ley de IA sobre los proveedores del modelo GPAI, con multas de hasta 15 millones de euros o el 3% de la facturación global, lo que sea mayor. Las organizaciones que modifiquen sustancialmente y coloquen un modelo abierto en el mercado de la UE pueden adquirir el estatus de proveedor, y las directrices de la Comisión tratan el cálculo de modificación superior a un tercio del original. La exención de código abierto de la Ley en virtud del Artículo 53(2) requiere una licencia genuinamente gratuita y de código abierto que permita el acceso, uso, modificación y redistribución, con pesos, arquitectura e información de uso todos públicos. Los pesos públicos por sí solos no califican. La licencia comunitaria de Llama conlleva un umbral de usuario activo mensual y un descalificador que la guía de la Comisión menciona explícitamente. Llama y Gemma juntas representan aproximadamente una quinta parte de los nuevos derivados en los recuentos de ATOM, y ambos cuentan con licencias que los criterios de la Comisión probablemente descalificarían. La clasificación de licencias se convierte en parte de la revisión de procedencia, y eso es exactamente lo que muestra el Explorador.
La pregunta de la junta directiva que surge primero después de la divulgación de la vulnerabilidad del modelo base es sencilla: «¿Cuál de nuestros modelos de producción hereda esta debilidad y cómo lo sabemos?» La respuesta hoy requiere una búsqueda manual en las páginas del repositorio, rastreando etiquetas autoinformadas que ningún análisis de nivel de peso ha confirmado. El Explorador convierte esa búsqueda en una búsqueda de los modelos que cubre.
Cuatro campos pertenecen al registro de aprobación que la mayoría de las organizaciones no tienen en la actualidad. Derivación basada en huellas dactilares basada en análisis de peso en lugar de una etiqueta autoinformada. Un recuento de archivos escaneados que reemplaza la suposición de cobertura con un recuento de escaneos medible. La sede del proveedor como un campo filtrable, reconociendo que la sede por sí sola no resuelve la exposición al control de exportaciones, ya que la propiedad y la ubicación de implementación también rigen la selección. Y el linaje de licencias surgió para que los equipos legales puedan identificar posibles términos ascendentes antes de que un modelo llegue a producción.
Cisco lanzó hoy Supply Chain Provenance Explorer y está disponible en procedencia.aidefense.cisco.com. La base de datos es gratuita, pública y no requiere un producto o cuenta de Cisco.
Qué cambia para un equipo de seguridad el 30 de julio
|
Lo que tiene el equipo hoy |
Lo que publica el Explorer |
Acción recomendada |
|
Radio de explosión después de una vulnerabilidad del modelo base. El nombre del modelo y la etiqueta base_model. Determinar qué modelos heredan una debilidad revelada es una búsqueda manual en las páginas del repositorio. |
Linaje basado en puntuaciones de similitud utilizando dos etapas puntuadas de huellas dactilares en metadatos de arquitectura y cinco señales de nivel de peso. El kit obtuvo una precisión del 96,4% en el umbral de 0,70. |
Adjunte una derivación respaldada por huellas dactilares a cada modelo en el inventario de activos para que una divulgación desencadene una revisión del alcance en lugar de una búsqueda. |
|
Cobertura de escaneo de malware. Una insignia a nivel de archivo por archivo. En un punto de revisión determinado, un repositorio puede contener archivos sin resultados de análisis completos. La cobertura ha sido una suposición. |
Recuentos de archivos escaneados y hallazgos de malware o archivos inseguros reportados por modelo, a partir del escaneo basado en ClamAV. La cobertura del escaneo se vuelve legible antes de la aprobación en lugar de deducirse de una credencial. |
Reemplace la suposición de que se escaneó un modelo con el recuento registrado. Cuando la cobertura sea parcial, documente si la brecha es aceptable y por qué. |
|
Jurisdicción del proveedor. El nombre de una organización en una página del repositorio. Un derivado a varios pasos de su origen muestra quién subió el contenido, no el antepasado. |
Sede del proveedor, sitio web y organizaciones HF asociadas como campo filtrable. La sede por sí sola no resuelve la exposición al control de las exportaciones. |
Agregue jurisdicción al registro de aprobación. Cualquier equipo que modifique sustancialmente y coloque un modelo abierto en el mercado de la UE se enfrenta a posibles obligaciones de proveedor en virtud de la Ley de IA de la UE. |
|
Obligaciones de licencia. Una etiqueta de licencia que describe lo que el usuario cree que se aplica. Es posible que los términos de un modelo base ascendente no aparezcan en la página que lee el ingeniero. |
Limitaciones comunes por modelo, incluida la atribución, los términos no comerciales, las restricciones geográficas y los casos de uso prohibidos. El linaje de huellas dactilares ayuda a los equipos legales a identificar posibles términos ascendentes. |
Dirija el linaje de licencia a legal antes de la producción, no después de que un contrato haga referencia a él. Documente la posición en el momento de la aprobación en lugar de reconstruirla durante una disputa. |













































































