Les derniers modèles IA open source : ce qui est sorti en 2026
Les modèles d’IA open source ont connu plusieurs sorties majeures en 2026. Thinking Machines a rendu Inkling gratuit pour les agents IA le 22 aoĂ»t, un modèle open-weight de 975 milliards de paramètres, selon Journal Tech. Meta a dĂ©voilĂ© dĂ©but aoĂ»t Glimmer, qui tient sur un PC avec moins de 20 Go, Alibaba a publiĂ© Qwen 3.8-Max, Z.ai a sorti GLM-5.3 le 14 aoĂ»t, et Moonshot AI a publiĂ© Kimi K3, le plus gros modèle ouvert jamais tĂ©lĂ©chargĂ©. Ce guide fait le point sur ces nouveautĂ©s et ce qu’elles changent pour une TPE ou un indĂ©pendant.
Au sommaire
- Pourquoi l’open source compte en 2026
- Inkling : un géant gratuit pour les agents IA
- GLM-5.3 : le post-entraînement qui change tout
- Meta Glimmer : l’IA qui tient sur un PC
- Mistral : Medium 3.5 et Small 4, la gamme européenne
- Qwen 3.6-27B : le code à prix réduit
- Qwen 3.8-Max : l’IA qui travaille seule
- Kimi K3 : le plus gros modèle ouvert jamais publié
- DeepSeek V4 : le rapport coût et performance
- Ce que ça change concrètement pour une TPE
- FAQ : questions pratiques avant de tester
Pourquoi l’open source compte en 2026
Les modèles « ouverts » se distinguent des assistants grand public sur un point : leurs poids sont tĂ©lĂ©chargeables et peuvent tourner sur votre propre machine ou serveur, sans passer par une API. C’est cette libertĂ© qui intĂ©resse les entreprises : pas de facturation Ă l’usage, pas de dĂ©pendance Ă un fournisseur unique, et des donnĂ©es qui ne quittent pas le pĂ©rimètre de l’entreprise.
Cette annĂ©e, le rythme des sorties s’est accĂ©lĂ©rĂ©. Entre le 9 juin et le 3 aoĂ»t 2026, dix-huit modèles majeurs ont Ă©tĂ© ajoutĂ©s par le classement Vals AI, selon le bilan d’Origin Labs, et le mouvement s’est poursuivi en aoĂ»t avec GLM-5.3 puis Inkling. Meta avec Glimmer, Thinking Machines avec Inkling, Alibaba avec Qwen, Z.ai avec GLM, Moonshot avec Kimi K3, Mistral avec Medium 3.5 et Small 4, DeepSeek avec V4 : chaque famille pousse un avantage diffĂ©rent, la taille rĂ©duite, la souverainetĂ© europĂ©enne, le code, ou le coĂ»t d’utilisation. Le point commun : ces modèles sont disponibles en open source ou en open weight, c’est-Ă -dire avec leurs poids publiĂ©s, comme le rappelle notre comparatif des modèles open source publiĂ© en juillet.
Inkling : un géant gratuit pour les agents IA
La nouvelle la plus rĂ©cente vient de Thinking Machines. Le 22 aoĂ»t 2026, l’entreprise a ouvert l’accès gratuit Ă Inkling, son modèle open-weight de 975 milliards de paramètres (dont 41 milliards actifs par token), via OpenRouter, d’après Journal Tech. Le modèle est multimodal (texte, images, audio) avec un contexte d’un million de tokens, de quoi traiter de très longs documents.
La condition de cette gratuitĂ© est prĂ©cise : le modèle doit ĂŞtre utilisĂ© dans des contextes d’agents, au sein d’outils comme Claude Code ou Hermes Agent. L’objectif affichĂ© est de collecter des donnĂ©es d’utilisation anonymisĂ©es pour amĂ©liorer les compĂ©tences du modèle. C’est une stratĂ©gie Ă double tranchant pour les entreprises : d’un cĂ´tĂ©, un accès gratuit Ă un modèle massif ; de l’autre, un modèle qui apprend de vos usages. La version allĂ©gĂ©e Inkling Small (276 milliards de paramètres, 12 milliards actifs) avait Ă©tĂ© lancĂ©e prĂ©cĂ©demment, toujours selon Journal Tech.
GLM-5.3 : le post-entraînement qui change tout
Z.ai a publiĂ© GLM-5.3 le 14 aoĂ»t 2026, un modèle open-weight positionnĂ© sur le codage et les agents autonomes. La particularitĂ© : il rĂ©utilise la mĂŞme base Mixture-of-Experts de 743 milliards de paramètres que GLM-5.2, et chaque gain provient d’un post-entraĂ®nement intensifiĂ© plutĂ´t que d’une nouvelle architecture, selon l’analyse d’Eigent.
Z.ai dĂ©crit la mĂ©thode comme un passage Ă l’Ă©chelle par environnements : le modèle est plongĂ© dans un ensemble bien plus large d’environnements de travail professionnel simulĂ©s, et c’est ce sur-entraĂ®nement qui fait bondir les performances en codage et en agents, toujours selon Eigent. Le mĂŞme article signale une compĂ©tence en cybersĂ©curitĂ© que la sociĂ©tĂ© affirme ne pas avoir planifiĂ©e, et prĂ©cise que les poids open source ne sont pas encore tous disponibles. C’est un point de donnĂ©es utile pour qui suit jusqu’oĂą le post-entraĂ®nement seul peut pousser un modèle ouvert.
Meta Glimmer : l’IA qui tient sur un PC
DĂ©but aoĂ»t 2026, Meta a publiĂ© Glimmer, un modèle distillĂ© depuis Muse Spark, sa famille fermĂ©e lancĂ©e en avril. Il est compressĂ© sous les 20 Go par quantification et pensĂ© pour tourner sur un Mac ou un PC Ă©quipĂ© d’une seule carte graphique grand public, d’après 01net. Ses poids sont dĂ©posĂ©s sur Hugging Face avec la documentation. Ce lancement accompagne un plaidoyer de Mark Zuckerberg en faveur de l’IA ouverte, publiĂ© le mĂŞme jour, rapporte l’Opinion.
Son terrain de jeu est l’agentique au sens pratique : gĂ©rer un agenda, ranger des fichiers, appeler des outils, enchaĂ®ner plusieurs Ă©tapes et se rattraper quand l’une d’elles part de travers. Ce n’est pas un modèle de tĂŞte, et il ne prĂ©tend pas l’ĂŞtre : c’est un assistant local, gratuit, qui exĂ©cute des tâches de bureau sans envoyer de donnĂ©es Ă un serveur. Pour une TPE, c’est la promesse d’un outil d’IA rĂ©ellement « chez soi », sur une machine dĂ©jĂ prĂ©sente dans l’entreprise.
Mistral : Medium 3.5 et Small 4, la gamme européenne

Côté européen, Mistral AI a étoffé sa gamme ouverte. La page officielle des modèles Mistral liste désormais Mistral Medium 3.5 en tête de gamme généraliste, décrit comme performant tout en restant économique, et Mistral Small 4, multimodal et multilingue, publié sous licence Apache 2.0. À plus petite échelle, Ministral 3 (8B) vise les déploiements à la périphérie, sur des machines modestes.
La gamme spĂ©cialisĂ©e s’Ă©largit aussi : Devstral 2 pour l’ingĂ©nierie logicielle autonome, Codestral pour la complĂ©tion de code, Mistral OCR 4.1 pour l’extraction de documents, Voxtral TTS pour la synthèse vocale et Shieldstral pour la modĂ©ration de contenu. Pour une entreprise française, l’intĂ©rĂŞt de cette famille est double : des modèles ouverts et un acteur europĂ©en, ce qui simplifie les questions de protection des donnĂ©es par rapport Ă des API hĂ©bergĂ©es hors de l’Union europĂ©enne.
Qwen 3.6-27B : le code à prix réduit

Alibaba Cloud a lancĂ© en avril 2026 Qwen 3.6-27B, un modèle de 27 milliards de paramètres orientĂ© gĂ©nĂ©ration de code, selon Treelink. Sur les benchmarks acadĂ©miques HumanEval et MBPP, il atteint 85 Ă 92 % de prĂ©cision en gĂ©nĂ©ration de code, contre 89 Ă 94 % pour GPT-4 selon le test rĂ©alisĂ© par Treelink. Sa fenĂŞtre de contexte de 128 000 tokens permet d’auditer une base de code entière ou d’analyser une cinquantaine de pages en une seule requĂŞte.
L’argument Ă©conomique est marquĂ© : l’appel API chez Alibaba Cloud revient Ă environ 0,003 $ pour 1 000 tokens, contre 0,03 $ pour GPT-4, soit un coĂ»t environ dix fois infĂ©rieur sur la mĂŞme base, toujours selon Treelink. Pour une PME qui automatise du code, de l’analyse de documents ou des tâches rĂ©pĂ©titives, c’est l’exemple type d’un modèle open source qui rend le coĂ»t de l’IA marginal, sans sacrifier la qualitĂ© sur les usages courants.
Qwen 3.8-Max : l’IA qui travaille seule
Alibaba a publiĂ© dĂ©but aoĂ»t 2026 les poids de Qwen 3.8-Max, un modèle de 2 400 milliards de paramètres, selon le bilan d’Origin Labs. Sa particularitĂ© est l’autonomie : on lui confie un objectif ambitieux et il travaille seul pendant des heures ou des jours, corrige ses propres erreurs, ajuste sa stratĂ©gie et livre un rĂ©sultat fini sans relance, dĂ©crit Les NumĂ©riques.
Sur les Ă©preuves standardisĂ©es, il obtient 93,0 sur PaperBench, qui mesure la capacitĂ© Ă reproduire un article scientifique en code, contre 88,8 pour Fable 5 (le modèle avancĂ© d’Anthropic), et 86,1 sur OSWorld, qui mesure l’aptitude Ă utiliser un ordinateur comme un humain, le meilleur score tous modèles confondus, toujours selon Les NumĂ©riques. Alibaba affirme mĂŞme que le modèle aurait dĂ©veloppĂ© seul un logiciel pendant 16 jours, en Ă©crivant le code, en le testant et en le corrigeant sans intervention. C’est un changement de nature : l’IA ouverte n’est plus seulement un assistant, elle devient un exĂ©cutant capable de mener un chantier entier.
Kimi K3 : le plus gros modèle ouvert jamais publié
Le laboratoire pĂ©kinois Moonshot AI a publiĂ© le 29 juillet 2026 sur Hugging Face les poids de Kimi K3, un modèle de 2 800 milliards de paramètres, le plus gros modèle open weight jamais proposĂ© en tĂ©lĂ©chargement libre, d’après IT-Connect. LancĂ© le 16 juillet uniquement en service hĂ©bergĂ©, il est devenu tĂ©lĂ©chargeable onze jours plus tard, dans une archive d’environ 1,5 tĂ©raoctet, accompagnĂ©e d’un rapport technique.
Sa fiche technique impressionne : 2 800 milliards de paramètres au total (dont 104 milliards activĂ©s par jeton), 896 experts, une fenĂŞtre de contexte d’environ un million de tokens et une comprĂ©hension native du texte et des images, dĂ©taille IT-Connect. Sur les benchmarks publiĂ©s par l’Ă©diteur, il atteint 93,5 sur GPQA Diamond et 91,2 sur BrowseComp. Le mĂŞme article rappelle une limite importante : Kimi K3 n’est pas distribuĂ© sous licence open source (MIT ou Apache 2.0) mais sous une licence open weight, plus restrictive, et son Ă©diteur reconnaĂ®t que ses performances restent en retrait par rapport aux modèles propriĂ©taires les plus puissants. En pratique, une archive de 1,5 tĂ©raoctet n’est pas exĂ©cutable sur un ordinateur de bureau : ce modèle s’adresse aux entreprises disposant d’une infrastructure serveur consĂ©quente.
DeepSeek V4 : le rapport coût et performance
DeepSeek a officialisĂ© V4 le 24 avril 2026, avec deux variantes : V4-Pro (1,6 trillion de paramètres) et V4-Flash (284 milliards), selon l’analyse de Studeria. Le modèle est publiĂ© en open source sur Hugging Face, avec un contexte d’un million de tokens et une architecture Hybrid Attention. Ses benchmarks rivalisent avec les modèles propriĂ©taires du moment, tout en restant 5 Ă 10 fois moins cher Ă l’API sur les gros volumes, d’après la mĂŞme source. Une variante V4 Flash 0731, centrĂ©e sur les tâches agentiques, a suivi le 31 juillet selon Origin Labs.
Le point de vigilance pour une entreprise française est la localisation : l’API officielle est hĂ©bergĂ©e en Chine, ce qui pose une question de transfert de donnĂ©es hors de l’Union europĂ©enne. La parade est justement l’open source : les poids Ă©tant publiĂ©s, une Ă©quipe technique peut hĂ©berger le modèle en interne ou chez un hĂ©bergeur europĂ©en, et bĂ©nĂ©ficier du rapport coĂ»t et performance sans dĂ©pendre de l’API chinoise. C’est le compromis que beaucoup d’entreprises regardent en 2026 : un modèle puissant, hĂ©bergĂ© oĂą l’on veut.
Ce que ça change concrètement pour une TPE
Pour un commerçant, un artisan ou un indĂ©pendant, ces sorties ne signifient pas qu’il faut installer un modèle demain matin. Elles signifient que le paysage a changĂ© : l’IA n’est plus rĂ©servĂ©e aux grands groupes ni aux abonnements coĂ»teux. Trois usages concrets se dĂ©gagent.
Le traitement de documents. Un modèle local ou une API ouverte peut résumer des devis, des factures ou des courriers, et structurer les informations dans un tableur. Les volumes sont modestes, la qualité suffisante, et le coût par document devient négligeable.
L’assistant administratif. Des modèles comme Glimmer, pensĂ©s pour tourner sur un PC de bureau, peuvent gĂ©rer un agenda, trier des fichiers ou prĂ©parer des brouillons de rĂ©ponse. L’avantage : les donnĂ©es restent sur la machine, ce qui Ă©vite les questions de confidentialitĂ©.
Le code et la maintenance. Une TPE qui s’appuie sur un prestataire pour son site ou ses outils peut demander l’intĂ©gration d’un modèle de code comme Qwen 3.6 ou GLM-5.3 pour automatiser des tâches simples, ou utiliser un modèle ouvert pour vĂ©rifier du contenu. LĂ encore, le coĂ»t marginal est faible.
Avant de se lancer, trois vĂ©rifications s’imposent : la configuration matĂ©rielle (un modèle compact tourne sur un ordinateur rĂ©cent, un gros modèle comme Kimi K3 demande une infrastructure serveur), la licence (toutes les « open source » ne sont pas Ă©quivalentes, certaines limitent l’usage commercial), et la localisation des donnĂ©es si l’on passe par une API. Notre guide comparatif dĂ©taille ces points plus en profondeur.
FAQ : questions pratiques avant de tester
Un modèle open source peut-il vraiment tourner sur mon ordinateur ?
Oui, selon la taille. Un modèle de 8 milliards de paramètres comme Ministral 3 tourne sur une machine rĂ©cente, et Glimmer est compressĂ© sous 20 Go pour fonctionner avec une seule carte graphique grand public, d’après 01net. Les gros modèles comme DeepSeek V4-Pro, Kimi K3 ou Inkling demandent une infrastructure serveur.
« Open source » veut-il dire gratuit et libre d’usage ?
Pas toujours. Les licences diffèrent : Mistral Small 4 est sous Apache 2.0, très permissive, mais Kimi K3 est distribuĂ© sous une licence open weight plus restrictive, et d’autres modèles dits « ouverts » limitent l’usage commercial. Il faut lire la licence de chaque modèle avant de l’intĂ©grer dans un produit.
Quelle différence entre une API et un modèle installé en local ?
L’API est simple Ă brancher mais facture Ă l’usage et envoie les donnĂ©es chez le fournisseur. Le local est plus technique Ă installer, mais les donnĂ©es restent chez vous et le coĂ»t devient fixe (Ă©lectricitĂ© et matĂ©riel). Le choix dĂ©pend de la sensibilitĂ© des donnĂ©es et de la compĂ©tence technique disponible.
Les modèles chinois sont-ils utilisables par une entreprise française ?
Oui, sous conditions. DeepSeek V4, Qwen 3.8-Max, Kimi K3 et GLM-5.3 sont publiĂ©s avec leurs poids : on peut les hĂ©berger en interne ou chez un hĂ©bergeur europĂ©en, ce qui Ă©limine le transfert de donnĂ©es vers l’Asie. C’est d’ailleurs le principal argument des modèles ouverts face aux API fermĂ©es : la localisation devient un choix, pas une contrainte.
Quel budget matériel pour un modèle local ?
Un PC rĂ©cent avec une carte graphique grand public suffit pour les modèles compacts comme Glimmer, compressĂ© sous 20 Go selon 01net, ou Qwen 3.6-27B. Au-delĂ , il faut un serveur dĂ©diĂ© ou une machine plus costaude. Pour la plupart des usages de bureau, le matĂ©riel existant de l’entreprise est suffisant.
Sources
- Journal Tech, Thinking Machines ouvre Inkling gratuitement (22/08/2026)
- Eigent, analyse de GLM-5.3 de Z.ai (14/08/2026)
- 01net, Meta dévoile Glimmer (11/08/2026)
- l’Opinion, plaidoyer de Mark Zuckerberg pour l’IA ouverte (11/08/2026)
- Mistral AI, page officielle des modèles
- Treelink, test de Qwen 3.6-27B (24/04/2026)
- Les Numériques, Qwen 3.8-Max (03/08/2026)
- IT-Connect, Kimi K3, le plus gros modèle IA ouvert (29/07/2026)
- Studeria, analyse de DeepSeek V4 (24/04/2026)
- Le Monde, DeepSeek dévoile V4 (24/04/2026)
- Origin Labs, bilan des nouveaux modèles IA de l’Ă©tĂ© 2026
- Normandie Digital, comparatif des modèles IA open source
