Apple lleva desde 2024 ejecutando un sistema de inteligencia artificial de dos niveles en tu iPhone, y la mayoría de los estudiantes de ML no se dieron cuenta
La investigación de ML publicada por Apple revela una arquitectura híbrida que combina un modelo en el dispositivo de ~3.000 millones de parámetros con modelos de servidor más grandes en Private Cloud Compute, lo que está transformando silenciosamente la forma en que debemos pensar sobre la implementación de la IA.
Imagina cada iPhone con iOS 18, ahora mismo, tomando una decisión silenciosa antes de que termines de escribir tu frase: ¿esta solicitud es lo suficientemente sencilla como para procesarla localmente, o necesita escalar? Esa decisión ocurre en milisegundos, dentro de una arquitectura que la mayoría de los cursos de ML nunca describen, a una escala que la mayoría de los ingenieros de ML nunca llegan a implementar. Apple lleva ejecutando un sistema de inferencia de dos niveles en cientos de millones de dispositivos desde que anunció Apple Intelligence en la WWDC 2024, y la investigación detrás de él es considerablemente más interesante de lo que las diapositivas de marketing sugerían. El debate binario que domina la mayoría de las conversaciones sobre implementación de IA —en el dispositivo versus en la nube— siempre ha sido un falso dilema. La investigación publicada por Apple lo demuestra en producción. Entender cómo funciona realmente su sistema es una de las lecciones arquitectónicas más útiles disponibles para cualquiera que estudie los pipelines de implementación modernos, y lo mejor es que Apple lo dejó todo por escrito.
La arquitectura de dos niveles: un teléfono, dos cerebros
El sistema de modelos de base de Apple no es un único modelo. Según la propia publicación de investigación en aprendizaje automático de Apple de junio de 2024, Apple Intelligence está compuesto por múltiples modelos generativos especializados para las tareas cotidianas de los usuarios. En el núcleo se encuentra un modelo de aproximadamente 3 mil millones de parámetros que se ejecuta completamente en el dispositivo, optimizado específicamente para el chip Apple Silicon. Junto a él existe un modelo más grande basado en servidores, diseñado para Private Cloud Compute, que gestiona las solicitudes que superan lo que el modelo en el dispositivo puede resolver con confianza.
Las decisiones de ingeniería que hacen viable el modelo en el dispositivo con 3B de parámetros merecen estudiarse con detenimiento. El Informe Técnico 2025 de Apple (publicado en julio de 2025, disponible en arxiv.org/abs/2507.13575) describe dos innovaciones arquitectónicas específicas: el uso compartido de caché KV y el entrenamiento consciente de cuantización a 2 bits. El uso compartido de caché KV reduce la presión sobre el ancho de banda de memoria durante la inferencia, lo cual importa enormemente cuando se opera dentro del margen térmico y de memoria de un teléfono. El entrenamiento consciente de cuantización a 2 bits es agresivo por cualquier estándar; significa que el modelo aprende, durante el propio entrenamiento, a ser robusto frente a la pérdida de precisión que introduce la cuantización, en lugar de que esa precisión se elimine después del hecho como algo secundario.
El modelo de servidor, por su parte, está construido sobre lo que Apple denomina una arquitectura transformer de Mezcla de Expertos en Pistas Paralelas (PT-MoE, por sus siglas en inglés), según el mismo Informe Técnico 2025. La Mezcla de Expertos es un diseño en el que un modelo contiene múltiples subredes especializadas y activa solo un subconjunto para cada entrada determinada (piénsalo como un hospital que tiene muchos especialistas en plantilla, pero que solo llama a los relevantes para tus síntomas específicos). El enfoque de "pistas paralelas" sugiere que la variante de Apple añade innovaciones estructurales sobre el patrón MoE estándar, aunque los detalles técnicos completos se encuentran en el artículo de arxiv y no en la publicación resumida.
Qué significa realmente "Private Cloud Compute" para la arquitectura
Aquí es donde la historia se vuelve genuinamente instructiva para quienes aprenden sobre implementación. El componente del lado del servidor de Apple Intelligence no es una llamada genérica a una API en la nube de un proveedor externo. La investigación y la documentación de seguridad de Apple describen Private Cloud Compute como una infraestructura dedicada donde la inferencia en el servidor se ejecuta sobre Apple Silicon, no sobre clústeres de GPU convencionales. Trail of Bits, una firma de investigación en seguridad que analizó la versión original de la WWDC 2024, señaló que Apple se esfuerza en especificar que no existe ninguna dependencia de hardware NVIDIA ni de las APIs de CUDA en ninguna parte del sistema: el entrenamiento utiliza el framework AXLearn de Apple (que se ejecuta sobre TPUs y Apple Silicon), la inferencia del modelo en el servidor corre sobre Apple Silicon, y las APIs en el dispositivo usan CoreML y Metal.
La implicación arquitectónica para quienes aprenden es significativa. El "servidor" en este sistema de inferencia dividida no es un despliegue estándar en la nube. Es una infraestructura construida con un propósito específico que ejecuta la misma familia de chips que el dispositivo cliente, lo cual genera propiedades interesantes en cuanto a latencia, eficiencia energética y control de la cadena de suministro que un despliegue típico de nube más móvil no tendría. Esto importa cuando razonas sobre cómo replicar o aprender de este patrón: la coherencia del hardware entre niveles es parte del diseño, no una coincidencia.
La actualización de Apple para la WWDC 2025 (publicada el 9 de junio de 2025) también introdujo un framework de Modelos de Base que ofrece a los desarrolladores de aplicaciones de terceros acceso directo al modelo de lenguaje de base en el dispositivo. Esto significa que el mismo modelo de 3B de parámetros que está en el núcleo de Apple Intelligence ahora es accesible para los desarrolladores que crean aplicaciones, lo cual eleva considerablemente el valor educativo: la arquitectura que Apple diseñó para sus funciones internas se está convirtiendo en un objetivo de implementación para el ecosistema más amplio.
Lo que el modelo realmente hace: tareas, no trucos
Es fácil perderse en los detalles arquitectónicos y olvidar preguntarse qué está haciendo realmente el sistema. La publicación de investigación original de Apple de junio de 2024 describe los modelos de base como ajustados para experiencias que incluyen escribir y refinar texto, priorizar y resumir notificaciones, y crear imágenes para conversaciones. No son pruebas de benchmark artificiales; son tareas de producción que se ejecutan con datos reales de usuarios en dispositivos reales, lo cual impone restricciones que los modelos optimizados para benchmarks simplemente no enfrentan.
El diseño de inferencia dividida refleja directamente estos requisitos de tareas. El resumen de notificaciones, por ejemplo, es una tarea de baja latencia y sensible a la privacidad, donde enviar datos a un servidor con cada notificación sería tanto lento como incómodo para los usuarios. El modelo en el dispositivo se encarga de estos casos. La asistencia de escritura más compleja, que podría requerir un conocimiento del mundo más amplio o un razonamiento con contexto más largo, se enruta al modelo del servidor cuando es necesario. La lógica de enrutamiento en sí misma es una propiedad aprendida del sistema, no una regla codificada de forma rígida, lo cual es un detalle importante para cualquiera que diseñe pipelines similares.
El Informe Técnico 2025 también señala que la nueva generación de modelos es multilingüe y multimodal, y maneja tanto texto como otras modalidades en los dispositivos y servicios de Apple. El alcance ha crecido considerablemente desde el lanzamiento inicial de 2024, lo cual vale la pena tener en cuenta para quienes estudian cómo evolucionan los sistemas de IA en producción: la arquitectura que estudias hoy será significativamente diferente en dieciocho meses, pero los principios de diseño subyacentes tienden a mantenerse estables.
Qué significa esto para quienes aprenden a construir pipelines de implementación
La lección práctica aquí no es "copia la arquitectura de Apple." La mayoría de quienes aprenden no están implementando en cientos de millones de dispositivos ni tienen granjas de servidores con Apple Silicon. La lección es más sutil y más transferible: el enfoque binario de inferencia en el dispositivo versus en la nube es una simplificación que se derrumba en cuanto los requisitos de implementación se vuelven específicos. La latencia, la privacidad, la capacidad del modelo, las restricciones de hardware y la complejidad de las tareas empujan en diferentes direcciones de forma simultánea, y una arquitectura por niveles es con frecuencia la respuesta de ingeniería honesta a esa tensión.
Para quienes estudian pipelines de implementación, la investigación publicada por Apple es inusualmente transparente sobre las compensaciones de diseño. La publicación de investigación original de 2024, la actualización de la WWDC 2025 y el Informe Técnico 2025 (completo con el artículo de arxiv en arxiv.org/abs/2507.13575) conforman juntos uno de los relatos públicos más detallados sobre cómo está estructurado realmente un sistema de IA de consumo importante. Leerlos en secuencia, desde la descripción inicial de la arquitectura hasta las innovaciones PT-MoE en el informe de 2025, ofrece una visión longitudinal poco común de cómo evoluciona un sistema en producción bajo las restricciones del mundo real.
El framework de Modelos de Base anunciado en la WWDC 2025, que abre el modelo en el dispositivo a desarrolladores de terceros, es el hilo que vale la pena seguir tirando. Señala que el nivel en el dispositivo de este sistema de dos niveles es ahora una plataforma para desarrolladores, no solo una herramienta interna de Apple. Si estás aprendiendo desarrollo para iOS, implementación de ML o NLP en el dispositivo, ese framework es donde comienza la exploración práctica.
Tu teléfono lleva ejecutando un sistema de inferencia distribuida de nivel de posgrado desde 2024, y el programa de estudios estuvo público todo el tiempo.