Un modèle de 27 milliards de paramètres tourne maintenant sur un iPhone
Un modèle de 27 milliards de paramètres, dans sa version complète, ça pèse dans les 54 Go. Impossible à charger sur un téléphone, difficile même sur un Mac correct. PrismML vient de sortir Bonsai 27B, une version compressée du même modèle qui tient dans 3,9 Go et tourne directement sur un iPhone. Pas une démo bricolée en labo : un modèle qu'on peut télécharger dès aujourd'hui, gratuitement, sous une licence qui autorise même un usage commercial (Apache 2.0).
PrismML part de Qwen3.6 27B, un modèle du chinois Alibaba, et le compresse en deux versions plus légères. La version ternaire (chaque poids du modèle, un des chiffres qui définissent ce qu'il "sait", ne vaut plus que -1, 0 ou +1 au lieu d'un nombre à virgule) pèse 5,9 Go et vise les ordinateurs portables. La version 1-bit, encore plus radicale (les poids ne valent plus que -1 ou +1), pèse 3,9 Go et vise le téléphone. Voilà à quoi ça ressemble sur le papier.
La technique : pas besoin de tout réentraîner
Ce qui rend ce genre d'annonce intéressante, c'est rarement le chiffre de compression, c'est la méthode utilisée pour y arriver. BitNet, le projet de Microsoft le plus connu sur les poids ternaires, réentraîne un modèle depuis zéro avec cette contrainte posée dès le départ. Ça coûte très cher en calcul, et ça veut dire repartir de rien à chaque nouvelle base de modèle.
Bonsai fait autrement : une quantization (le terme technique pour "réduire la précision des nombres qui composent le modèle") appliquée après coup, sur un modèle déjà entraîné, avec un réglage de calibrage partagé par petits groupes de 128 poids. Autrement dit, on prend le Qwen3.6 27B déjà prêt, et on le compresse par petits paquets sans repasser par un entraînement complet. Sur le papier, une compression aussi brutale sans réentraînement devrait donner un modèle à moitié gâteux. Perso, c'est ce chiffre-là qui m'a fait tiquer : la version ternaire retient 94,6 % du score du modèle d'origine sur les 15 tests que PrismML utilise pour comparer ses modèles, et même la version 1-bit en garde 89,5 %. Dans le détail, ça se dégrade plus sur certaines tâches : en code, le 1-bit tombe à 81,9 contre 88,7 pour le modèle complet ; sur les tâches où le modèle doit se servir d'outils tout seul, l'écart se creuse encore, 66 contre 80. Rien d'illisible, mais c'est là que ça pique le plus si vous comptiez sur Bonsai pour faire tourner un agent en autonomie.
Ce que ça donne en usage réel
Sur un iPhone 17 Pro Max, PrismML annonce environ 11 tokens par seconde en génération avec la version 1-bit (un token, c'est le petit bout de mot que le modèle produit à chaque étape, grosso modo les trois quarts d'un mot). Sur un Mac M5 Max, la version ternaire grimpe autour de 87 tokens par seconde selon leurs propres chiffres. Sur une carte graphique RTX 5090, on monte à 163 tokens par seconde. La fenêtre de contexte, c'est à dire la quantité de texte que le modèle peut lire et garder en tête d'un coup, va jusqu'à 262 000 tokens : largement de quoi lui faire lire un dossier de code entier sans qu'il oublie le début.
Petit bémol de prudence, parce que ce sont PrismML qui mesurent leurs propres chiffres : les tests indépendants publiés par MarkTechPost donnent des débits nettement plus modestes sur Mac, autour de 26 tokens par seconde en ternaire. Comme souvent avec un lancement, le chiffre de la présentation officielle est le meilleur cas, pas la moyenne. Avant de bâtir un projet dessus, testez-le vous-même sur votre matériel.
Pourquoi ça compte pour un développeur
L'intérêt n'est pas d'avoir un chatbot de plus dans la poche. C'est d'avoir un modèle qui tourne directement sur l'appareil, sans connexion internet, sans facture d'API à la fin du mois, avec assez de mémoire pour de vraies tâches d'agent : lire un projet, appeler des outils, raisonner en plusieurs étapes. Tout ce qui, jusqu'ici, ne tournait que dans le cloud parce qu'aucun modèle de cette taille ne rentrait sur un appareil normal.
Le modèle se récupère sur Hugging Face (la plateforme où la plupart des modèles d'IA ouverts sont hébergés) et sur GitHub, ou directement via l'application iOS Locally AI pour ceux qui veulent juste l'essayer sans monter tout un système d'inférence maison. Licence Apache 2.0, donc aucun blocage pour un usage commercial.
Je reste prudent sur les 90 % de rétention tant que je ne l'ai pas fait tourner moi-même sur un vrai projet de code, mais l'idée d'avoir un modèle de cette classe qui répond directement sur l'appareil, sans latence réseau et sans que vos prompts partent chez qui que ce soit, ça vaut clairement le détour.
En tout cas, j'ai essayé le plus gros modèle sur mon iPhone Pro 17 avec Locally AI, je suis impressionné (évidemment je suis français, ici une capture d'écran avec une réponse en français), impressionnant !


Rejoignez la conversation
Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.
Aucun commentaire pour le moment.