ByteDance construit un modèle de 10 000 milliards de paramètres. C'est le chiffre le moins intéressant de l'affaire.

ByteDance construit un modèle de 10 000 milliards de paramètres. C'est le chiffre le moins intéressant de l'affaire.


Le 7 août, le Financial Times annonce que ByteDance, la maison mère de TikTok, entraîne un modèle d'intelligence artificielle pouvant atteindre 10 000 milliards de paramètres. L'information vient de trois personnes au courant du projet. ByteDance refuse de commenter et aucune date de sortie n'a été annoncée.

Le chiffre a fait le tour du monde en deux jours. Pourtant, il ne veut presque rien dire. Le modèle dont je te parlais hier permet de comprendre pourquoi.

Un moteur industriel gigantesque suspendu à une grue, descendu vers le capot d'une petite voiture citadine qui ne peut manifestement pas l'accueillir

Il rentre, promis. Il faut juste enlever les sièges. Et la voiture.

Ce qu'on sait vraiment

Un paramètre est un réglage interne que le modèle apprend pendant son entraînement. Un modèle peut en compter des milliers de milliards. C'est aussi l'un des rares chiffres qu'une entreprise peut annoncer avant même d'avoir terminé son modèle. Pratique pour fabriquer un titre sans avoir encore rien prouvé.

Le modèle est en préentraînement. C'est la première phase, celle où il avale des données en vrac. Elle dure trois à six mois. Il faut ensuite affiner le modèle pour lui apprendre à répondre correctement. Même son nombre final de paramètres n'est pas encore fixé.

Graphique en barres du nombre de paramètres en milliards, de 284 pour DeepSeek V4-Flash à 10 000 pour ByteDance, les estimations en barres creuses

Les barres pleines représentent des chiffres publiés. Les barres creuses, des estimations. Devine lesquelles font les meilleurs titres.

Pour situer le projet, Kimi K3, jusqu'ici le plus gros modèle chinois, tourne autour de 2 800 milliards de paramètres. Le secteur estime Mythos 5 d'Anthropic à environ 8 000 milliards, mais personne ne l'a confirmé. ByteDance viserait donc le haut du classement mondial.

Pourquoi ce chiffre ne dit presque rien

Hier, je te racontais l'histoire de DeepSeek V4-Flash-0731. Regarde la première barre du graphique : 284 milliards de paramètres. C'est trente-cinq fois moins que le projet de ByteDance. Pourtant, ce petit modèle bat le gros modèle de sa propre maison de plus de dix points dans les tests où il doit accomplir des tâches. Son architecture n'a pas changé. Seule sa phase d'affinage a été refaite.

Le nombre de paramètres est au modèle ce que la cylindrée est à la voiture. Il donne une idée de la taille du moteur. Il ne dit rien de la consommation, de la tenue de route ou de la capacité du machin à démarrer le matin.

Ce qui compte vraiment, c'est l'architecture du modèle, la qualité des données et surtout son affinage. Trois éléments impossibles à résumer en un seul nombre. Étrangement, ils intéressent beaucoup moins les communiqués.

Le détail que personne n'a mis en titre, alors qu'il vaut mieux que le chiffre

Zhang Yiming, le fondateur de ByteDance, a dit à ses équipes qu'il refusait la distillation pour ce modèle. La distillation consiste à apprendre en copiant les réponses d'un modèle concurrent déjà performant. On lui pose des millions de questions, on récupère ses réponses, puis on entraîne son propre modèle avec ces données. C'est rapide, efficace et à peu près tout le monde le fait.

Refuser cette méthode, c'est accepter de prendre plusieurs mois de retard sur ses rivaux chinois. C'est un choix industriel coûteux et engageant. Personnellement, je trouve ça cent fois plus intéressant qu'un compteur de paramètres. Je ne l'ai pourtant vu nulle part en gros titre.

Doubao, le deuxième assistant du monde dont tu n'as jamais entendu parler

Voilà le vrai enseignement de cette histoire. Et il n'a rien à voir avec l'entraînement en cours.

ByteDance possède déjà un assistant appelé Doubao. En avril 2026, il comptait 336 millions d'utilisateurs actifs par mois. Il était premier en Chine et deuxième dans le monde, derrière ChatGPT et devant tous les autres.

Un stade immense rempli de dizaines de milliers de personnes avec une banderole 336 millions d'utilisateurs, et au premier plan une personne sur son canapé qui n'en a aucune idée

Deuxième assistant du monde. Demande autour de toi ce midi, tu vas t'amuser.

Demande à dix personnes autour de toi de citer un assistant IA. Tu entendras ChatGPT dix fois. Peut-être Claude ou Gemini une fois. Doubao, zéro. Un produit utilisé par plus de personnes que la population des États-Unis reste parfaitement invisible chez nous.

Ce n'est pas une question de qualité, mais de marché. Une bonne partie de ce qui se passe aujourd'hui dans l'IA ne parvient tout simplement jamais jusqu'à nous.

Concrètement, ça change quoi pour toi

Si tu ne codes pas et que tu n'as pas TikTok, tu te demandes probablement ce que tu fais là. Il y a trois réponses. La première est la plus utile.

Comparaison, à gauche un vieil appareil photo affichant 20 mégapixels avec une photo floue, à droite un téléphone moderne affichant 12 mégapixels avec une photo nette

On a déjà vécu exactement ça. Les chiffres étaient exacts. La conclusion, beaucoup moins.

Tu as déjà appris à te méfier de ce genre de chiffre. Souviens-toi des mégapixels. Pendant dix ans, chaque appareil photo affichait un nombre plus élevé que son voisin. Alors on achetait celui qui en avait le plus. Puis on a compris que la taille du capteur, l'optique et le logiciel faisaient la photo, pas ce nombre. Aujourd'hui, un téléphone de 12 mégapixels écrase un compact de 20 mégapixels datant de 2009. Pour les paramètres, on en est exactement au même stade. Quand tu liras le prochain titre annonçant 10 000 milliards, tu sauras quoi en faire.

Cette course fait baisser ta facture. Pas la leur, la tienne. Quand quatre géants se battent pour proposer la même fonction, le prix s'effondre. Chez DeepSeek, on est passé à 0,28 dollar par million de mots générés, contre 25 dollars pour les modèles haut de gamme. Résultat, la transcription de tes messages vocaux, le tri de tes photos ou les sous-titres automatiques cessent d'être des abonnements mensuels. Ils deviennent de simples options dans un logiciel que tu possèdes déjà.

Tu utiliseras peut-être ce modèle sans le savoir. Un modèle ne se vend pas seulement en direct. Il peut aussi être loué à d'autres applications. Le moteur qui répond dans ton application de retouche photo ou dans ton assistant de voiture n'a aucune raison de porter un nom connu. Soyons honnêtes sur le calendrier : ce modèle n'existe pas encore. Il sortira peut-être dans six mois, dans un an ou jamais. Personne n'a annoncé de date.

Ce que j'en pense

Le plus frappant n'est pas la course. C'est notre angle mort. On commente en boucle trois entreprises américaines pendant qu'un assistant utilisé par 336 millions de personnes se développe sans obtenir une ligne chez nous.

Concernant le chiffre lui-même, je vais être direct : aujourd'hui, 10 000 milliards de paramètres ne sont pas une information. C'est une intention. Le modèle n'existe pas encore. Il ne sait rien faire et personne ne l'a testé. On commente un devis, pas une maison.

La vraie question est de savoir si le pari de Zhang Yiming tiendra. Refuser de copier ses concurrents quand tout le monde le fait, c'est soit de l'orgueil coûteux, soit le seul moyen de finir par les dépasser. Vu d'ici, les deux se ressemblent beaucoup.

#Intelligence artificiellebytedancemodeleschinedoubaodeepseek
Rejoignez la conversation

Vous devez avoir un compte pour commenter cet article. La création est gratuite et prend moins d'une minute.

  • Le fichier XMLTV à télécharger gratuitement, chaque jour
  • Commenter les articles et répondre aux autres lecteurs
  • Être averti par e-mail des nouveaux articles que vous suivez

Aucun commentaire pour le moment.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙