Le domaine des modèles d'IA est difficile à parcourir en 2026 : chaque grand laboratoire publie plusieurs versions par trimestre, et l'écart entre les performances des modèles à poids ouverts et des modèles fermés se resserre à chaque sortie. Ce comparatif couvre 15 modèles et plateformes qu'un praticien compétent devrait présélectionner, à destination des développeurs qui choisissent un modèle pour la production, des chercheurs qui évaluent des architectures et des équipes techniques qui construisent des produits propulsés par LLM. Le paysage est déséquilibré : trois fournisseurs de modèles fermés (OpenAI, Google, Anthropic) dominent la plupart des classements, tandis que le palier à poids ouverts est devenu réellement compétitif pour les tâches de codage, de contexte long et de raisonnement. Les candidats ont été écartés s'ils n'étaient que de minces surcouches tierces, s'ils relevaient principalement de la génération d'images ou de la vision par ordinateur, ou s'ils doublonnaient une entrée déjà couverte.
Comment nous avons choisi
Les candidats proviennent de la sélection mise en avant par ToolPotion et de la matrice de similarité ML pour la catégorie Modèles d'IA et LLM. Le site et la page de tarification de chaque outil ont été vérifiés en août 2026. Aucun parrainage, aucun classement par affiliation.
Comparatif rapide
| Outil | Idéal pour | Point fort | Tarifs |
|---|---|---|---|
| GPT-5.6 | Usage général de pointe | Famille à trois niveaux, contexte de 1M de tokens | À partir de 0,20 $/1,20 $ par 1M de tokens, 20 $/mois pour Plus |
| Gemini 3.1 Pro | Raisonnement multimodal | Contexte de 1M, réflexion à trois niveaux | À partir de 1,25 $/10 $ par 1M de tokens |
| Claude Opus 4.8 / Sonnet 4.6 | Codage, agents, RAG | Contexte de 1M, suivi des instructions | Sonnet 3 $/15 $, Opus 5 $/25 $ par 1M de tokens |
| DeepSeek-R1 | Raisonnement open source | Entraîné par RL, licence MIT | Chat gratuit, API via des fournisseurs |
| DeepSeek-V4-Pro | Contexte long d'un million de tokens | 1,6T MoE, contexte de 1M de tokens | ~1,98 $/M en sortie |
| Kimi K3 | Codage à poids ouverts de pointe | 2,8T MoE, contexte de 1M | 3 $/15 $ par 1M de tokens |
| Qwen3.8-27B | Vision-langage en local | 27B dense, Apache 2.0, image/vidéo | Téléchargement gratuit, API cloud variable |
| Meta Llama 4 | Contexte ultra-long | Contexte de 10M de tokens (Scout) | Poids gratuits, licence communautaire |
| gpt-oss-120b | Poids ouverts sur un seul GPU | 120B Apache 2.0, tient sur une seule H100 | Poids gratuits, API à la consommation par token |
| Cohere Command R+ | RAG d'entreprise | Contexte de 128K, précision des citations | 2,50 $/10 $ par 1M de tokens |
| AI21 Jamba | Contexte long efficient | SSM-Transformer, contexte de 256K | 2 $/8 $ par 1M de tokens (Large) |
| Llama-3.1-8B-Instruct | Inférence en périphérie et en local | 8B, multilingue, usage commercial | Gratuit via Hugging Face |
| OpenRouter | API LLM unifiée | 346+ modèles, une seule clé, bascule de secours | Répercussion, frais de crédit ~5,5 % |
| Weights & Biases | Entraînement et évaluation de modèles | Suivi des expériences + LLMOps | Personnel gratuit, Teams 50 $/utilisateur/mois |
| Novita AI | Cloud de modèles pour développeurs | 200+ API + bacs à sable d'agents | À la consommation par token, GPU à partir de 0,14 $/Mt |
1. GPT-5.6 : la famille de pointe à paliers d'OpenAI
Le GPT-5.6 d'OpenAI est sorti en juillet 2026 sous la forme d'une famille à trois niveaux : Luna (économique), Terra (intermédiaire) et Sol (fleuron). Les trois partagent une fenêtre de contexte de 1,05M de tokens, 128K en sortie et une entrée texte plus image.
Idéal pour : les équipes qui veulent une relation avec un fournisseur unique, avec un solide usage d'outils, du fine-tuning, l'Assistants API et l'exécution de code.
La profondeur de l'écosystème fait la différence : sorties structurées, appel de fonctions, Batch API et Responses API fonctionnent de façon cohérente sur tous les paliers. Luna, à 0,20 $/1,20 $ par 1M de tokens, rend les charges à haut volume viables sans changer de fournisseur. Passez votre chemin si les règles de résidence des données imposent un hébergement sur site ou dans l'UE : il vous faut Azure OpenAI Service, ce qui ajoute une complexité d'achat.
ChatGPT Plus : 20 $/mois. API Luna : 0,20 $/1,20 $ par 1M de tokens.
2. Gemini 3.1 Pro : le modèle de raisonnement multimodal de Google
Sorti le 19 février 2026, Gemini 3.1 Pro accepte le texte, les images, l'audio, la vidéo et les dépôts de code avec une fenêtre de contexte de 1M de tokens et jusqu'à 64K tokens en sortie.
Idéal pour : le raisonnement multimodal poussé : synthèse de recherche à partir de PDF et de vidéos, génération de code sur de grands dépôts, analyse de documents longs.
Le système de réflexion à trois niveaux, doté d'un nouveau paramètre « Medium », permet aux développeurs de régler le curseur entre latence et profondeur pour chaque appel, en évitant le coût complet des tokens de réflexion à chaque requête. L'arrêt des modèles Gemini 2.5 est prévu pour octobre 2026, ce qui fait de 3.1 Pro la ligne active. Attention à la hausse de tarif à 2,50 $/15 $ par 1M de tokens au-delà de 200K tokens.
API : 1,25 $/10,00 $ par 1M de tokens en dessous de 200K tokens.
3. Claude Opus 4.8 / Sonnet 4.6 : les modèles orientés agents d'Anthropic
La gamme d'Anthropic mi-2026 se répartit nettement : Sonnet 4.6 pour l'inférence en production et le RAG standard ; Opus 4.8 pour le raisonnement complexe en plusieurs étapes et le codage agentique. Les deux prennent en charge un contexte de 1M de tokens à des tarifs forfaitaires par token.
Idéal pour : les systèmes agentiques en production, le codage complexe et les entreprises exigeant un suivi strict des instructions.
La marque de fabrique de Claude est le respect des instructions au fil de nombreux appels d'outils sans dérive d'objectif, le mode de défaillance qui provoque les boucles d'agents. Épinglez explicitement les versions de modèle. La gamme d'Anthropic évolue souvent. Opus 4.8 est coûteux pour les pipelines à forte production de sortie.
Sonnet 4.6 : 3,00 $/15,00 $ par 1M de tokens. Opus 4.8 : 5,00 $/25,00 $ par 1M de tokens. Le traitement par lots est 50 % moins cher.
4. DeepSeek-R1 : raisonnement open source à grande échelle
DeepSeek-R1 est entraîné par apprentissage par renforcement et montre sa chaîne de pensée, ce qui est utile pour les tâches où la transparence du raisonnement compte, pas seulement la réponse finale.
Idéal pour : les chercheurs et les équipes qui ont besoin d'un modèle de raisonnement performant qu'ils peuvent inspecter, affiner et déployer commercialement sans friction de licence.
La licence MIT autorise le déploiement local et le fine-tuning commercial sans redevances. Les traces de raisonnement visibles de R1 sont largement utilisées comme signal d'entraînement dans les pipelines de distillation. À surveiller : le modèle complet nécessite une VRAM GPU substantielle (la plupart des déploiements auto-hébergés utilisent des versions quantifiées), et l'API hébergée a connu des problèmes de fiabilité en charge de pointe.
L'accès par chat est gratuit. Poids sur Hugging Face sous licence MIT. Les coûts en auto-hébergement varient.
5. DeepSeek-V4-Pro : contexte d'un million de tokens à l'échelle de la production
DeepSeek-V4-Pro est sorti en août 2026 avec 1,6T de paramètres (49B actifs via MoE) et un contexte natif de 1M de tokens. Son attention creuse compressée hybride ne nécessite que 27 % des FLOPs de la génération précédente à pleine longueur de contexte, ce qui rend l'inférence sur un million de tokens économiquement praticable, et pas seulement techniquement possible.
Idéal pour : les tâches à long horizon qui exigent l'analyse de grandes bases de code, la revue juridique ou financière de plusieurs documents, ou des sessions agentiques prolongées.
V4-Flash (284B de paramètres, 13B actifs) est un point de départ plus sûr pour les équipes qui évaluent l'architecture avant de s'engager sur les exigences d'infrastructure de V4-Pro. Très récent à la publication, les données de stabilité en production sont donc limitées.
Des sources tierces indiquent ~1,98 $/M de tokens en sortie. Vérifiez les tarifs actuels dans la documentation de l'API de DeepSeek.
6. Kimi K3 : modèle de codage à poids ouverts de pointe
Kimi K3 est le modèle MoE de 2,8T de paramètres de Moonshot AI, lancé le 16 juillet 2026, avec des poids publiés le 27 juillet sous licence Modified MIT. Il vise le codage à long horizon, la navigation dans de grands dépôts et l'usage agentique soutenu d'outils avec un contexte de 1M de tokens.
Idéal pour : les équipes d'ingénierie qui veulent un codage de niveau de pointe à partir d'un modèle à poids ouverts qu'elles peuvent déployer ou affiner sur leur propre infrastructure.
Sur FrontierSWE (tâches réelles de génie logiciel dans de grandes bases de code), Kimi K3 affiche 81,2, ce qui le place aux côtés des meilleurs modèles fermés spécifiquement pour le codage. L'auto-hébergement requiert une infrastructure multi-GPU même avec la quantification MXFP4. La plupart des équipes utilisent plutôt l'API de Kimi.
API : 3,00 $/15,00 $ par 1M de tokens.
7. Qwen3.8-27B : déploiement vision-langage en local
Qwen3.8-27B est le modèle dense à poids ouverts d'Alibaba d'août 2026, d'environ 27,8B de paramètres sous Apache 2.0, avec une compréhension native de l'image et de la vidéo, encore rare à une échelle inférieure à 30B.
Idéal pour : les équipes qui ont besoin d'un modèle déployable localement doté de vision pour des charges en périphérie, sensibles à la confidentialité ou isolées du réseau.
Apache 2.0 n'impose ni plafond de MAU ni restriction multimodale dans l'UE. Le mode hybride « Thinking/Non-Thinking » supprime la surcharge de raisonnement pour les appels sensibles à la latence. Prise en charge native de 119 langues. Passez votre chemin pour les mathématiques et le raisonnement ardus : Qwen3.8-Max (2,4T de paramètres) y est nettement plus fort.
Poids gratuits sous Apache 2.0. Les tarifs de l'API cloud via Alibaba Model Studio varient selon la région.
8. Meta Llama 4 : contexte ultra-long à poids ouverts
Meta Llama 4 se décline en variantes Scout (17B actifs / 109B au total, contexte de 10M de tokens) et Maverick (17B actifs / 400B au total). Les deux utilisent le MoE et acceptent nativement une entrée texte, image et vidéo. C'est la première génération de Llama avec multimodalité intégrée.
Idéal pour : la recherche et les équipes qui traitent des collections massives de documents dans un seul contexte : bases de code entières, corpus de découverte juridique, archives de transcriptions sur plusieurs années.
Le contexte de 10M de tokens de Scout ouvre des cas d'usage impossibles en dessous de 1M : analyse en une seule passe de gros dossiers réglementaires, de bases de code de plateforme complètes ou d'années de documents internes. À noter : la licence communautaire Llama 4 comporte un plafond de 700M de MAU et restreint l'usage multimodal dans l'UE.
Poids sous licence communautaire Llama 4. L'inférence hébergée via les partenaires cloud de Meta se fait à la consommation par token.
9. gpt-oss-120b : le modèle à poids ouverts sur un seul GPU d'OpenAI
gpt-oss-120b est la première sortie à poids ouverts significative d'OpenAI depuis GPT-2, publiée en août 2025 sous Apache 2.0. Avec 120B de paramètres à activation creuse, il est conçu pour tenir sur un seul GPU H100 de 80 Go, contrairement aux modèles qui exigent des clusters multi-nœuds.
Idéal pour : les organisations qui veulent un raisonnement quasi de pointe sur un seul serveur, avec un accès complet à la chaîne de pensée, une profondeur de raisonnement configurable et une licence commerciale permissive.
Trois niveaux d'effort de raisonnement, traces exposées, appel de fonctions et sortie structurée via la Responses API. Apache 2.0 autorise le fine-tuning commercial sans restriction. Passez votre chemin pour le contexte d'un million de tokens (128K seulement) ou l'entrée multimodale (texte uniquement).
Poids gratuits sous Apache 2.0. API hébergée via OpenAI et des fournisseurs tiers à la consommation par token.
10. Cohere Command R+ : spécialiste du RAG d'entreprise
Cohere Command R+ est conçu spécifiquement pour la génération augmentée par récupération en entreprise : contexte de 128K, forte précision des citations et usage d'outils en plusieurs étapes, ciblant les sources hallucinées et la mauvaise attribution dans les flux documentaires.
Idéal pour : les entreprises qui construisent des systèmes de connaissances, des questions-réponses sur documents et des recherches clients où l'attribution des sources n'est pas négociable.
Dans les comparatifs RAG en tête-à-tête, Command R+ produit des citations plus exactes et moins d'hallucinations que des modèles généralistes de taille comparable. Les options de déploiement en VPC et sur site répondent aux exigences de résidence des données des secteurs réglementés. Ce n'est pas un généraliste : son plafond en raisonnement et en codage est plus bas que celui des modèles de pointe.
API : 2,50 $/10,00 $ par 1M de tokens. Tarifs VPC d'entreprise sur demande.
11. AI21 Jamba : hybride SSM-Transformer pour contextes longs
AI21 Jamba utilise une architecture hybride Mamba et Transformer, obtenant une inférence plus rapide et un coût de cache KV inférieur à celui des modèles purement Transformer à longueurs de contexte comparables. Résultat : une fenêtre de contexte effective de 256K, moins chère par appel.
Idéal pour : les entreprises qui traitent des documents longs en volume, là où le coût d'inférence est une variable budgétaire : analyse juridique, de conformité et financière à fréquence d'appels élevée.
L'avantage de débit de Jamba sur les contextes longs permet des applications synchrones orientées utilisateur qui, autrement, exigeraient des contournements de streaming coûteux. VPC et déploiement sur site via le programme entreprise d'AI21. L'outillage autour de Jamba est plus mince que pour les grandes familles : moins d'intégrations communautaires et de guides de fine-tuning.
Jamba-Large : 2,00 $/8,00 $ par 1M de tokens. Jamba-Mini : 0,20 $/0,40 $ par 1M de tokens.
12. Llama-3.1-8B-Instruct : inférence locale et en périphérie légère
Llama-3.1-8B-Instruct est le modèle multilingue de 8B ajusté par instructions de Meta. Il tourne sur une seule RTX 4090 ou un GPU d'ordinateur portable à forte mémoire, avec une fenêtre de contexte de 128K.
Idéal pour : les déploiements en périphérie, les applications sur appareil, les pipelines à haut débit et faible latence, et les charges où le coût GPU par requête doit être minimisé.
Les tâches de classification, de résumé, d'extraction d'entités et de sortie structurée s'exécutent vite et à bas coût. C'est le point de contrôle de fine-tuning le plus utilisé, avec un profond soutien communautaire via Hugging Face, Ollama et llama.cpp. Limite stricte : ne l'utilisez pas pour le codage complexe en plusieurs étapes, le raisonnement ardu ou les tâches à forte intensité de connaissances ; 8B de paramètres ne suffisent pas.
Gratuit sous la licence communautaire Llama 3 de Meta.
13. OpenRouter : passerelle unifiée vers 346+ LLM
OpenRouter achemine vers plus de 346 modèles chez Anthropic, OpenAI, Google, DeepSeek, Meta, Mistral, xAI et d'autres via une seule clé d'API compatible OpenAI, avec bascule de secours automatique entre fournisseurs.
Idéal pour : les équipes qui comparent des modèles, construisent des produits agnostiques au fournisseur ou prototypent sans gérer plusieurs SDK et comptes de facturation.
Tarification répercutée plus environ 5,5 % sur les achats de crédits. Des dizaines de modèles sont gratuits avec des limites de débit. La surcharge de ~15 ms est négligeable pour la plupart des charges. Passez votre chemin si vous en faites l'unique dépendance de production : une panne d'OpenRouter affecte chaque modèle que vous acheminez par son biais. Meilleur schéma : utilisez-le pour l'évaluation, et repliez-vous sur les SDK directs des fournisseurs pour les chemins de production critiques.
Sans abonnement : vous payez via des crédits aux tarifs répercutés.
14. Weights & Biases : plateforme d'entraînement et d'évaluation de modèles
Weights & Biases (W&B) n'est pas un modèle. C'est la plateforme que les équipes ML utilisent pour les construire et itérer dessus : suivi des expériences, balayages d'hyperparamètres, registre de modèles, traçage LLMOps via Weave et pipelines de fine-tuning. Le rachat par CoreWeave en 2025 a ajouté des GPU Sandboxes intégrés pour l'entraînement sans serveur.
Idéal pour : les équipes ML qui entraînent ou affinent des modèles et ont besoin d'un suivi d'expériences reproductible et d'audits de qualité partagés entre les membres de l'équipe.
Weave capture les paires prompt/réponse, la latence et le nombre de tokens sur l'ensemble des appels de LLM, avec des jeux d'évaluation pour suivre les variations de qualité d'une version de modèle à l'autre, ce qui est opérationnellement significatif pour l'ingénierie sérieuse des prompts. Si vous voulez les fonctions d'évaluation sans la plateforme W&B complète, il vous faut un outillage sur mesure.
Niveau personnel gratuit, permanent. Teams : 50 $/utilisateur/mois. Enterprise sur demande.
15. Novita AI : cloud de modèles pour développeurs et infrastructure GPU
Novita AI propose plus de 200 modèles de LLM, d'image, d'audio et de vidéo via une seule API, plus des bacs à sable d'agents isolés conçus sur mesure et des clusters de GPU bare-metal : un seul compte du prototypage à la production.
Idéal pour : les développeurs individuels et les petites équipes qui veulent une seule plateforme pour le prototypage, les tests d'agents et la montée en charge GPU sans achat en mode entreprise.
Le bac à sable d'agent (des environnements d'exécution isolés où les agents peuvent exécuter du code, utiliser des outils et appeler des modèles en toute sécurité) est la fonction la plus distinctive pour les équipes qui développent des flux de travail agentiques. Novita AI est un agrégateur de commodité : la qualité et la latence du modèle proviennent des fournisseurs d'origine en amont. Les équipes qui ont besoin de SLA garantis, d'un fine-tuning natif du fournisseur ou de certifications de conformité spécifiques devraient s'adresser directement à la source.
À la consommation par token (DeepSeek V4 Pro affiché à 1,74 $/M en entrée en août 2026), GPU à partir de 0,14 $/Mt, sans dépense minimale.
Comment choisir
Pour la capacité de pointe, les trois modèles fermés de pointe (GPT-5.6 Sol, Gemini 3.1 Pro et Claude Opus 4.8) constituent la comparaison pertinente. Tous sont compétitifs sur les tâches générales. Les différenciateurs sont la profondeur de l'écosystème (OpenAI), l'ampleur multimodale (Gemini) et le suivi agentique des instructions (Claude). OpenRouter donne un accès API aux trois depuis une seule clé pour l'évaluation. Parcourez tous les outils de modèles d'IA et de LLM dans l'annuaire ou filtrez par scénario sur la page des outils de développement et la page de la tâche d'entraînement de modèles.
Pour le contrôle des données ou l'efficience des coûts, le palier à poids ouverts de 2026 est compétitif. Kimi K3 domine les évaluations de type SWE-bench mais nécessite une infrastructure multi-GPU. gpt-oss-120b tient sur une seule H100 sous Apache 2.0, et Llama-3.1-8B-Instruct gère bien les tâches bien définies à haut volume pour une fraction du coût. Pour les acheteurs en entreprise ayant des exigences de RAG, de conformité ou de déploiement sur site, Cohere Command R+ et AI21 Jamba proposent tous deux le VPC et le déploiement sur site, conçus sur mesure pour les flux réglementés à forte intensité documentaire où un point d'inférence partagé n'est pas acceptable.
Foire aux questions
Quelle est la différence entre les modèles d'IA à poids ouverts et open source ?
À poids ouverts signifie que les poids du modèle sont téléchargeables publiquement, mais que le code d'entraînement, les données et le processus peuvent rester propriétaires. Open source, au sens de la définition de l'OSI, exige que tout le pipeline d'entraînement soit public. La plupart des modèles « ouverts » en 2026 (Llama 4, Kimi K3, gpt-oss-120b) sont à poids ouverts. Pour le déploiement, la question pratique est de savoir si la licence autorise l'usage commercial et le fine-tuning.
Quel modèle d'IA est le meilleur pour les tâches de codage ?
Pour les modèles fermés, Claude Opus 4.8 et GPT-5.6 Sol se situent régulièrement près du sommet. Pour le codage à poids ouverts, Kimi K3 domine les benchmarks de type SWE-bench, tandis que gpt-oss-120b le suit de près sur le raisonnement à forte composante mathématique. Llama-3.1-8B-Instruct gère efficacement les complétions simples mais n'est pas compétitif pour le débogage complexe multi-fichiers ou le travail au niveau de l'architecture.
Que signifie fenêtre de contexte et pourquoi est-ce important ?
La fenêtre de contexte est le maximum de texte qu'un modèle peut traiter en un seul appel, entrée et sortie combinées. Une fenêtre de 128K couvre environ 100 000 mots, 1M couvre environ 750 000, et les 10M de Llama 4 Scout gèrent environ 7,5 millions de mots en une seule passe. Des fenêtres plus longues permettent le traitement de documents entiers sans découpage, mais la plupart des fournisseurs facturent au token à un tarif forfaitaire, si bien que les contextes plus longs font croître le coût proportionnellement.
Puis-je utiliser ces modèles gratuitement ?
Plusieurs offrent un accès gratuit réel. DeepSeek-R1 est gratuit via le chat avec des poids sous licence MIT. OpenRouter propose des dizaines de modèles gratuits limités en débit. Llama-3.1-8B-Instruct et Qwen3.8-27B sont gratuits à auto-héberger. Weights & Biases dispose d'un niveau personnel gratuit permanent. Les fournisseurs de modèles fermés (OpenAI, Anthropic, Google) proposent des essais d'API gratuits qui basculent vers des offres payantes pour le trafic de production.