IA & Machine Learning Article original TECH ACTU

Ultrafast : GPT-5.6 Sol tourne desormais 14 fois plus vite

Jean-Paul Lesein 3 min de lecture 43 vues
Ultrafast : GPT-5.6 Sol tourne desormais 14 fois plus vite

OpenAI a dévoilé Ultrafast, un nouveau mode d'inférence pour GPT-5.6 Sol capable de générer jusqu'à 750 tokens par seconde, soit 14 fois plus vite que le mode standard, sans dégrader les capacités du modèle. La prouesse repose sur un partenariat avec Cerebras et ses puces Wafer-Scale Engine. Le mode est en preview limitée dans l'API, sans tarif ni date de disponibilité générale, avec des cas d'usage centrés sur la latence : support vocal, incidents, commerce conversationnel.

OpenAI vient de lever le voile sur Ultrafast, un nouveau mode d'inference pour GPT-5.6 Sol capable de générer jusqu'à 750 tokens par seconde, soit environ 14 fois plus vite que le mode standard, sans passer par une version allégée ou distillée du modèle. Une annonce technique en apparence discrète, mais qui change concrètement ce qu'on peut construire avec un modèle frontière.

Le même modèle, mais 14 fois plus rapide

Le point le plus important de cette annonce, c'est ce qu'elle n'est pas : il ne s'agit pas d'un GPT-5.6 Sol "mini" ou quantifié pour aller plus vite au prix de la qualité. OpenAI insiste sur le fait qu'Ultrafast fait tourner exactement le même modèle que le mode standard, avec les mêmes capacités de raisonnement.

La prouesse vient de l'infrastructure : Ultrafast s'appuie sur les puces Wafer-Scale Engine de Cerebras, un fabricant spécialisé dans les processeurs IA à très haut débit mémoire. Selon les chiffres communiqués, GPT-5.6 Sol en mode Ultrafast serait cinq fois plus rapide qu'Opus 4.8 en mode Fast et onze fois plus rapide que Fable 5, les modèles concurrents cités en comparaison.

Un accès encore très restreint

Ultrafast est pour l'instant en preview limitée, disponible uniquement via l'API et réservé à un groupe restreint de clients. OpenAI n'a communiqué ni tarif ni date de disponibilité générale, se contentant d'annoncer un élargissement progressif de l'accès "à mesure que la capacité augmente".

Ce choix n'a rien d'anodin. Faire tourner un modèle frontière à 750 tokens/seconde consomme une quantité de calcul et de bande passante mémoire considérable. La rareté de l'accès reflète probablement une contrainte de capacité réelle côté Cerebras plus qu'une stratégie marketing de rareté artificielle.

Pourquoi la vitesse pure change la donne

On a tendance à penser les progrès des LLM en termes de raisonnement ou de benchmarks. Mais pour un développeur qui construit un produit, la latence est parfois le facteur limitant le plus concret, avant même les capacités du modèle.

OpenAI cite explicitement des cas d'usage où la vitesse conditionne la faisabilité même du produit : réponse aux incidents en temps réel, recherche financière, support client vocal, agents de commerce conversationnel. Dans ces contextes, un délai de deux ou trois secondes entre la question et la réponse casse l'expérience, quelle que soit la qualité du raisonnement derrière.

Pour les applications vocales en particulier, c'est un vrai seuil de bascule. Une latence sous la seconde permet des échanges qui ressemblent enfin à une conversation naturelle plutôt qu'à un échange de messages avec des pauses gênantes.

Le silicium redevient un argument de vente

Ce partenariat avec Cerebras confirme une tendance de fond dans l'industrie : la course à la performance ne se joue plus seulement au niveau des architectures de modèles, mais aussi au niveau du matériel d'inférence. Groq, Cerebras et d'autres fournisseurs de puces spécialisées se positionnent désormais comme des partenaires stratégiques directs des labos d'IA, et non plus comme de simples fournisseurs de calcul générique.

Pour OpenAI, s'appuyer sur du silicium tiers plutôt que sur sa seule infrastructure Azure/Nvidia est aussi un signal : la diversification des fournisseurs de calcul devient un enjeu stratégique à mesure que la demande d'inférence explose, portée par le milliard d'utilisateurs actifs de ChatGPT désormais annoncé par l'entreprise.

Ce qu'il faut surveiller

Deux questions restent ouvertes. D'abord le prix : faire tourner un modèle 14 fois plus vite a un coût, et il faudra voir si Ultrafast reste au tarif standard de GPT-5.6 Sol ou s'il devient une option premium facturée à part.

Ensuite, la généralisation de l'accès : pour l'instant réservé à quelques clients triés sur le volet, Ultrafast ne devient réellement intéressant pour l'écosystème de développeurs que le jour où n'importe quelle startup pourra l'activer sur son compte API. Si OpenAI tient sa promesse d'élargissement progressif, ce mode pourrait redéfinir les standards de latence attendus pour les agents et applications vocales dans les mois qui viennent.

Partager cet article

À lire aussi en IA & Machine Learning