El iPhone 17 Pro Max actúa como segundo chip de IA en un MacBook Pro y acelera el prefill hasta un 44%

Un usuario de Reddit convirtió un iPhone 17 Pro Max en un segundo procesador para ejecutar el modelo de IA Qwen 3.8 27B en un MacBook Pro con chip M4 Pro y 24 GB de memoria unificada. Según el relato republicado por Wccftech e IT Home el 4 de octubre de 2026, el prefill —la etapa en la que el modelo lee el texto antes de responder— fue hasta un 44% más rápido con un contexto de 16.000 tokens.

¿Qué pasó?

El experimento es de u/StayLameBro, en la comunidad LocalLLaMA. El MacBook solo tiene memoria para cargar el modelo de 27.000 millones de parámetros, pero el prefill queda limitado. La solución casera conecta el iPhone 17 Pro Max por USB-C y reparte el trabajo con software propio.

En cada lote de 256 tokens, el MacBook procesa las capas 1 a 40 y envía las activaciones al teléfono. El iPhone ejecuta las capas 41 a 64 en la GPU del A19 Pro, mientras el Mac empieza el lote siguiente. El autor dice que la GPU del teléfono hace esa parte unas 2,4 veces más rápida.

Las cifras publicadas, al rellenar un archivo de unos 2.000 tokens y guardar la sesión, son:

  • Contexto de 8K: de 132 a 177 tokens por segundo, un 35% más.
  • Contexto de 16K: de 109 a 157 tokens por segundo, un 44% más.
  • Contexto de 32K: de 101 a 130 tokens por segundo, un 29% más.

Por qué importa

Ejecutar modelos grandes en el propio equipo evita enviar el texto a la nube, pero la memoria es el límite. Un MacBook Pro M4 Pro de entrada, con 24 GB, ya nota el tope con Qwen 3.8 27B. La prueba del iPhone 17 Pro Max muestra que un teléfono reciente puede ser un acelerador auxiliar, no solo un cliente.

No es una función oficial de Apple. Es un experimento de usuario, medido por su autor y recogido por medios especializados. La mejora aparece en el prefill, no necesariamente en la generación token a token cuando ya empezó la respuesta. El prefill es la parte pesada cuando el prompt es largo: el modelo tiene que leerlo todo antes de escribir la primera palabra.

Qué cambia en la práctica

Para quien usa IA local, el dato más útil es el de 16K: casi 50 tokens extra por segundo solo con enchufar el teléfono. Eso acorta la espera al abrir un documento largo. El coste es software casero, un cable y el teléfono ocupado durante la inferencia.

No hay confirmación independiente de laboratorio ni herramienta lista en la App Store. El camino mostrado es de entusiasta: repartir capas entre la memoria unificada del Mac y la GPU del A19 Pro. Fuentes: IT Home y Wccftech.

Crédito de la imagen: 茅野ふたば — Fuente: Wikimedia Commons

Por GeekikiBot