Thinking Machines a publié Inkling le 15 juillet 2026 : le modèle lit du texte, des images et de l’audio et produit du texte. Selon sa carte Hugging Face, il convient à la conversation généraliste, au suivi de consignes et aux tâches multimodales.
Thinking Machines Inkling convient à la conversation généraliste et au suivi de consignes, selon sa carte Hugging Face. Les échanges peuvent aussi s’appuyer sur la parole : selon Thinking Machines, le modèle transcrit la parole, suit des consignes orales, répond à des questions sur des enregistrements et raisonne sur de l’audio long.
Vision et compréhension
Le modèle accepte des images pour décrire leur contenu, répondre à des questions et raisonner à partir des informations visuelles fournies, selon Thinking Machines. Thinking Machines annonce aussi de bons résultats sur les graphiques, les diagrammes et le raisonnement visuel mathématique.
Code
Inkling s’adresse notamment aux développeurs d’assistants de code et de systèmes agentiques, capables d’appeler des outils, selon sa carte Hugging Face. Pour ces usages, Thinking Machines indique l’avoir entraîné dans différents environnements de code et d’agents. Pendant l’entraînement, les jeux d’outils et leurs schémas variaient aléatoirement afin de rendre le modèle moins dépendant d’un environnement particulier.
Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.
Les performances de Thinking Machines Inkling
Thinking Machines Inkling obtenait, selon Thinking Machines, à sa sortie et avec un effort de 0,99, un score de 77,6 % sur SWE-bench Verified, mesuré avec un harnais d’évaluation utilisant uniquement bash. Avec le même niveau d’effort, il obtenait 87,2 % sur GPQA Diamond. Sur Terminal Bench, le modèle atteignait, selon l’éditeur et à sa sortie, la même performance que Nemotron 3 Ultra avec trois fois moins de tokens.
Bien utiliser Thinking Machines Inkling : réflexion et effort
Thinking Machines Inkling dispose, selon Thinking Machines, d’un effort de réflexion réglable pour équilibrer la performance et la consommation de tokens. Ce réglage se modifie depuis l’environnement de code ou d’agent. Sur OpenRouter, la réflexion est activée par défaut, mais elle peut être désactivée. Pour ajuster l’effort de réflexion, OpenRouter propose les valeurs max, high, medium, low, minimal et none, avec high comme valeur par défaut.
Caractéristiques techniques de Thinking Machines Inkling
Thinking Machines Inkling est distribué sous licence Apache 2.0. Selon Thinking Machines, le modèle est sorti le 15 juillet 2026.
Le tableau des caractéristiques reprend les données d’OpenRouter, dont la fenêtre de contexte et la longueur maximale d’une réponse. Selon Thinking Machines, Inkling prend en charge une fenêtre de contexte allant jusqu’à 1 million de tokens ; sur OpenRouter, elle est de 524 288 tokens, et une réponse compte au plus 262 144 tokens. Selon l’entreprise, le modèle accepte du texte, des images et de l’audio en entrée, mais produit uniquement du texte.
Selon Thinking Machines, Inkling est un transformer Mixture-of-Experts de 975 milliards de paramètres au total, dont 41 milliards actifs. Sa conception suit en grande partie celle de DeepSeek-V3 : 256 experts routés et 2 experts partagés par couche, dont 6 experts routés actifs par token. Il a été pré-entraîné sur 45 mille milliards de tokens de texte, d’images, d’audio et de vidéo. Selon sa carte Hugging Face, il est conçu pour l’anglais, avec des capacités multilingues générales dans d’autres langues, et lit l’audio au format WAV échantillonné à 16 kHz, idéalement en moins de 20 minutes. Sur OpenRouter, il accepte le paramètre tools, celui de l’appel d’outils.
Éditeur
Thinking Machines
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
524 k tokens
Réponse maximale (selon OpenRouter)
262 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Tâches
Aide au codeAffaires et financeDesign d'après référenceDonnées et analyseFront-endFullstackHTMLJeuxJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesReactRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte, Image, Audio
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolstemperaturetop_preasoningseedstopmax_tokens
Hébergeurs via OpenRouter
DeepInfra, Together
Où utiliser Thinking Machines Inkling
Thinking Machines Inkling était disponible à sa sortie sur Tinker, selon Thinking Machines. Cette plateforme d’entraînement permettait d’affiner le modèle pour un domaine particulier. Pour converser avec lui, les développeurs disposaient de l’Inkling Playground, une interface intégrée à la console Tinker. La carte d’accès à l’API donne son prix par million de tokens et ses hébergeurs via OpenRouter.
À sa sortie, les poids complets étaient également publiés sur Hugging Face, selon Thinking Machines. Ils étaient proposés en deux versions : le checkpoint original et un checkpoint NVFP4, destiné à l’inférence sur les systèmes NVIDIA Blackwell. Pour un déploiement local, le modèle prend en charge les bibliothèques open source SGLang, vLLM, TokenSpeed, Unsloth et Transformers de Hugging Face, selon sa carte de modèle.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que Thinking Machines, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,95 $ / M tokens en entrée, 4,05 $ / M tokens en sortie.
Tarification0,95 $ en entrée, 4,05 $ en sortie, par million de tokens
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
Thinking Machines Inkling parmi les versions d’Inkling
Thinking Machines Inkling est, selon Thinking Machines, le premier modèle d’une famille déclinée en différentes tailles. La frise des versions situe les modèles de cette famille avec leurs dates. Inkling-Small a été lancé deux semaines après l’annonce d’Inkling, selon l’éditeur. Son architecture Mixture-of-Experts, ou mélange d’experts, compte 276 milliards de paramètres, dont 12 milliards actifs.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
Thinking Machines InklingVous êtes ici
Inkling Small
Score
1427
1407
Sortie
Contexte
524 k tokens
524 k tokens
Prix d'entrée
0,95 $ / M tokens
0,45 $ / M tokens
Prix de sortie
4,05 $ / M tokens
1,20 $ / M tokens
Entrées
Texte, Image, Audio
Texte, Image, Audio
Réflexion
Activée par défaut
Activée par défaut
Tâches
Aide au code, Affaires et finance, Design d'après référence, Données et analyse, Front-end, Fullstack, HTML, Jeux, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, React, Rédaction créative, Santé et bien-être, Suivi de consignes
Aide au code, Affaires et finance, Design d'après référence, Données et analyse, Front-end, Fullstack, HTML, Jeux, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, React, Rédaction créative, Santé et bien-être, Suivi de consignes, Vision et compréhension
Ce qui le distingue
Thinking Machines a publié Inkling le 15 juillet 2026 : le modèle lit du texte, des images et de l’audio et produit du texte. Selon sa carte Hugging Face, il convient à la conversation généraliste, au suivi de consignes et aux tâches multimodales.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
Quand Thinking Machines Inkling est-il sorti ?
Inkling est sorti en juillet 2026, selon Thinking Machines. Sa date de sortie exacte est le 15 juillet.
Que peut lire Thinking Machines Inkling ?
Inkling lit du texte, des images et de l’audio en entrée, selon Thinking Machines. Il produit du texte en sortie.
Quelle est la fenêtre de contexte de Thinking Machines Inkling ?
Inkling prend en charge une fenêtre de contexte allant jusqu’à 1 million de tokens, selon Thinking Machines. Sur OpenRouter, sa fenêtre de contexte est de 524 288 tokens.
Combien de paramètres compte Thinking Machines Inkling ?
Inkling est un transformer à architecture Mixture-of-Experts, ou mélange d’experts, de 975 milliards de paramètres au total, selon Thinking Machines. Parmi eux, 41 milliards sont actifs.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.