Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.
Los modelos de IA en el dispositivo se han mantenido pequeños porque todo el conjunto de peso tiene que vivir en DRAM, lo que limita el recuento de parámetros prácticos muy por debajo de lo que utilizan las implementaciones del lado del servidor. Los arquitectos empresariales que evalúan cargas de trabajo agentes han tenido que elegir entre modelos capaces dependientes de la nube y modelos limitados en el dispositivo. Los modelos básicos de tercera generación de Apple, anunciados en la WWDC26, rompa esa restricción moviendo el peso que activa la DRAM por completo.
La familia AFM 3 fue desarrollada en colaboración con Google y abarca cinco modelos: dos en el dispositivo y tres basados en servidor, todos ejecutándose dentro de los límites de Private Cloud Compute de Apple. Los modelos del lado del servidor, incluido AFM 3 Cloud Pro para uso de herramientas de agente y razonamiento complejo, se ejecutan en GPU Nvidia en Google Cloud. La arquitectura del dispositivo es propia de Apple. AFM 3 Core Advanced es un modelo de 20 mil millones de parámetros que almacena pesos en memoria flash NAND en lugar de DRAM.
«En lugar de forzar todo el modelo a entrar en DRAM, el modelo completo se almacena en la memoria flash». El equipo de investigación de Apple escribió. «Debido a que el ancho de banda de NAND a DRAM es demasiado lento para intercambiar pesos token por token, como lo requieren los modelos MoE estándar, AFM 3 Core Advanced toma decisiones de enrutamiento según el mensaje».
Cómo funciona realmente la arquitectura
El muro de la memoria con el que Apple está trabajando es uno con el que se topan todos los desarrolladores locales de IA. «No se pueden poner 20B de parámetros en la RAM con una precisión razonable». Awni Hannuninvestigador de Anthropic y ex científico investigador de Apple, publicado en X. «Para que funcione, están utilizando una arquitectura bastante exótica para los estándares actuales. Un pequeño modelo predice a partir de la consulta (o aviso) qué expertos cargarán desde NAND a la RAM».
Ese mecanismo de predicción y carga tiene tres componentes distintos, cada uno impulsado por las limitaciones de hardware del silicio de consumo.
El conjunto completo de pesos de 20B se encuentra en flash, no en DRAM. AFM 3 Core Advanced almacena todo su conjunto de parámetros en memoria flash NAND en lugar de memoria activa. Las implementaciones estándar en el dispositivo requieren que el modelo completo se ajuste a la DRAM, que es lo que limita el recuento de parámetros. El enfoque de Apple, al que llama Poda de seguimiento de instrucciones (IFP) y desarrollado con sus propios investigadores, trata a la memoria flash como el hogar permanente del modelo y a la DRAM como un amortiguador de trabajo para los expertos que requiera una indicación determinada.
El enrutamiento experto ocurre una vez por mensaje, no por token. En un modelo convencional de Mezcla de Expertos, un enrutador selecciona diferentes expertos para cada token generado, lo que requeriría un movimiento continuo de peso entre la memoria flash y la DRAM a velocidad de inferencia. El ancho de banda de NAND a DRAM no puede admitir eso. AFM 3 Core Advanced enruta una vez en el momento oportuno, selecciona un conjunto de expertos fijo, lo carga en DRAM junto con expertos compartidos siempre activos y genera todos los tokens a partir de esa misma configuración. «La diferencia clave con un MoE típico es que esto se hace una vez por consulta y luego se generan todos los tokens con los mismos expertos», escribió Hannun.
El recuento de parámetros activos aumenta de 1B a 4B según la complejidad de la tarea. En lugar de ejecutar un tamaño de modelo fijo para cada solicitud, AFM 3 Core Advanced ajusta la cantidad de parámetros que activa según lo que requiere la tarea: mil millones para operaciones más simples, hasta 4 mil millones para operaciones más difíciles, todos extraídos del conjunto de 20 mil millones de parámetros en flash.
Lo que Apple ha revelado y lo que no ha revelado
El documento de arquitectura detalla el diseño de la memoria y el mecanismo de activación escasa. Es menos comunicativo en cuanto a las limitaciones prácticas de implementación.
Las herramientas de elaboración de perfiles de Apple exponen los tiempos, pero no las métricas que deciden la viabilidad de la producción. «¿Energía, ancho de banda de memoria, térmica? No está en los documentos», dijo Marco Abis, que está construyendo Ziraph, un generador de perfiles para IA local en el silicio de Apple. publicado en X. «Una brecha notable, dado que son ellos los que deciden la mayor parte del rendimiento del dispositivo».
Abis tampoco encontró una declaración en la documentación de Apple (en los documentos de Core AI, los documentos de Foundation Models o la publicación de seguridad de Private Cloud Compute) sobre cuándo se descarga de forma transparente una solicitud en el dispositivo o si ese enrutamiento es visible para el desarrollador o el usuario. Para las empresas que necesitan documentar dónde se ejecuta la inferencia, ese es un problema de cumplimiento directo.
No toda la información está disponible actualmente. Apple ha indicado que a finales de este verano llegará un informe técnico completo con puntos de referencia.
Qué significa esto para los arquitectos empresariales
Las industrias reguladas que evalúan implementaciones de IA agente ahora tienen que tomar una decisión arquitectónica concreta.
-
El muro de DRAM para agentes en el dispositivo acaba de moverse. Las empresas que evalúan agentes que necesitan ejecutarse sin un viaje de ida y vuelta a la nube ahora tienen una opción local de 20 mil millones de parámetros para evaluar. La restricción pasa de la capacidad del modelo al hardware del dispositivo.
-
El límite privado/nube es ahora una decisión arquitectónica, no una opción predeterminada. Las solicitudes más simples permanecen en el dispositivo; Las tareas complejas de agente se dirigen a AFM 3 Cloud Pro en Private Cloud Compute. Apple no ha especificado públicamente cuándo se descarga una solicitud o si esa ruta es visible para el desarrollador, una brecha que complica las decisiones políticas para las organizaciones que necesitan documentar dónde se ejecuta la inferencia.
-
El nivel del servidor agente depende de Google Cloud. AFM 3 Cloud Pro se ejecuta en GPU Nvidia en Google Cloud. La garantía Private Cloud Compute cubre la privacidad de los datos. No elimina la dependencia de Google Cloud para la inferencia del lado del servidor.
AFM 3 Core Advanced ofrece a las empresas una opción en el dispositivo de 20 mil millones de parámetros que no existía antes de la WWDC26. Que se pueda implementar a escala depende de las respuestas que Apple aún no ha publicado. Esos detalles se publicarán en el informe técnico de verano.















































































