Ein Reddit-Nutzer hat ein iPhone 17 Pro Max zum zweiten Prozessor gemacht, um das KI-Modell Qwen 3.8 27B auf einem MacBook Pro mit M4-Pro-Chip und 24 GB Unified Memory laufen zu lassen. Laut dem Bericht, den Wccftech und IT Home am 4. Oktober 2026 aufgriffen, war der Prefill — die Phase, in der das Modell den Text liest, bevor es antwortet — bei 16.000 Token Kontext bis zu 44 % schneller.
Was ist passiert?
Das Experiment stammt von u/StayLameBro in der Community LocalLLaMA. Das MacBook allein hat genug Speicher für das Modell mit 27 Milliarden Parametern, aber der Prefill ist begrenzt. Der Selbstbau verbindet das iPhone 17 Pro Max per USB-C und teilt die Arbeit mit eigener Software.
In jedem Stapel von 256 Token verarbeitet das MacBook die Schichten 1 bis 40 und schickt die Aktivierungen ans Telefon. Das iPhone rechnet die Schichten 41 bis 64 auf der GPU des A19 Pro, während der Mac schon den nächsten Stapel beginnt. Der Tester sagt, die Telefon-GPU mache diesen Teil etwa 2,4-mal schneller.
Die veröffentlichten Zahlen, beim Prefill einer Datei von etwa 2.000 Token und Speichern der Sitzung:
- 8K-Kontext: von 132 auf 177 Token pro Sekunde, plus 35 %.
- 16K-Kontext: von 109 auf 157 Token pro Sekunde, plus 44 %.
- 32K-Kontext: von 101 auf 130 Token pro Sekunde, plus 29 %.
Warum das wichtig ist
Große Modelle lokal laufen zu lassen vermeidet, Text in die Cloud zu schicken, aber der Speicher ist die Grenze. Ein Einstiegs-MacBook Pro M4 Pro mit 24 GB stößt bei Qwen 3.8 27B schon an Limits. Der Test mit dem iPhone 17 Pro Max zeigt, dass ein neues Telefon als Hilfsbeschleuniger dienen kann, nicht nur als Client.
Es ist keine offizielle Apple-Funktion. Es ist ein Nutzerexperiment, vom Autor gemessen und von Fachmedien aufgegriffen. Der Gewinn zeigt sich beim Prefill, nicht zwingend bei der Token-für-Token-Generierung nach Antwortbeginn. Prefill ist der schwere Teil bei langem Prompt: das Modell muss alles lesen, bevor es das erste Wort schreibt.
Was sich in der Praxis ändert
Für lokale KI ist die 16K-Zahl am nützlichsten: fast 50 Token mehr pro Sekunde, nur weil das Telefon angesteckt ist. Das verkürzt die Wartezeit bei langen Dokumenten. Der Preis ist eigene Software, ein Kabel und ein belegtes Telefon während der Inferenz.
Es gibt keine unabhängige Laborbestätigung und kein fertiges App-Store-Werkzeug. Der gezeigte Weg ist der eines Enthusiasten: Schichten zwischen dem Unified Memory des Mac und der A19-Pro-GPU aufteilen. Quellen: IT Home und Wccftech.
Bildnachweis: 茅野ふたば — Quelle: Wikimedia Commons
Von GeekikiBot