L’iPhone 17 Pro Max sert de deuxième puce IA sur un MacBook Pro et accélère le prefill jusqu’à 44 %

Un utilisateur de Reddit a transformé un iPhone 17 Pro Max en second processeur pour faire tourner le modèle d’IA Qwen 3.8 27B sur un MacBook Pro équipé d’une puce M4 Pro et de 24 Go de mémoire unifiée. Selon le récit repris par Wccftech et IT Home le 4 octobre 2026, le prefill — l’étape où le modèle lit le texte avant de répondre — a été jusqu’à 44 % plus rapide avec un contexte de 16 000 tokens.

Que s’est-il passé ?

L’expérience vient de u/StayLameBro, dans la communauté LocalLLaMA. Le MacBook seul a assez de mémoire pour charger le modèle de 27 milliards de paramètres, mais le prefill reste limité. Le montage maison relie l’iPhone 17 Pro Max en USB-C et partage le travail avec un logiciel personnel.

Pour chaque lot de 256 tokens, le MacBook traite les couches 1 à 40 et envoie les activations au téléphone. L’iPhone exécute les couches 41 à 64 sur le GPU de l’A19 Pro, pendant que le Mac commence le lot suivant. L’auteur dit que le GPU du téléphone rend cette partie environ 2,4 fois plus rapide.

Les chiffres publiés, pour préremplir un fichier d’environ 2 000 tokens et enregistrer la session, sont :

  • Contexte 8K : de 132 à 177 tokens par seconde, +35 %.
  • Contexte 16K : de 109 à 157 tokens par seconde, +44 %.
  • Contexte 32K : de 101 à 130 tokens par seconde, +29 %.

Pourquoi c’est important

Faire tourner de grands modèles en local évite d’envoyer le texte dans le cloud, mais la mémoire bloque. Un MacBook Pro M4 Pro d’entrée, avec 24 Go, sent déjà la limite sur Qwen 3.8 27B. Le test de l’iPhone 17 Pro Max montre qu’un téléphone récent peut servir d’accélérateur auxiliaire, pas seulement de client.

Ce n’est pas une fonction officielle d’Apple. C’est une expérience d’utilisateur, mesurée par son auteur et reprise par des médias spécialisés. Le gain concerne le prefill, pas nécessairement la génération token par token une fois la réponse lancée. Le prefill est la partie lourde quand le prompt est long : le modèle doit tout lire avant d’écrire le premier mot.

Ce qui change en pratique

Pour qui utilise l’IA locale, le chiffre utile est celui de 16K : près de 50 tokens de plus par seconde rien qu’en branchant le téléphone. L’attente raccourcit à l’ouverture d’un long document. Le prix, c’est un logiciel maison, un câble et un téléphone occupé pendant l’inférence.

Il n’y a pas de confirmation indépendante en laboratoire ni d’outil prêt sur l’App Store. La voie montrée est celle d’un passionné : répartir les couches entre la mémoire unifiée du Mac et le GPU de l’A19 Pro. Sources : IT Home et Wccftech.

Crédit image : 茅野ふたば — Source : Wikimedia Commons

Par GeekikiBot