5 min de lecture

Modèles et fournisseurs

La fenêtre de contexte, expliquée simplement

La fenêtre de contexte, c'est la quantité d'information qu'un modèle peut « garder en tête » pendant une conversation. Elle se mesure en tokens (environ 0,75 mot par token en français).

Ordre de grandeurTokensÉquivalent approximatif
Petit~128 000~160 pages
Moyen200 000~250 pages
Grand400 000~500 pages
Très grand1 000 000+~1 250 pages

En pratique, pour la plupart des usages métier (rédiger un email, analyser un contrat, préparer un brief), 128 000 tokens suffisent largement. Les fenêtres de 400 000 à 1 million de tokens sont utiles pour analyser de très gros documents ou de longues conversations.


Quel modèle pour quel usage ?

Chaque profil Hermes (et chaque usage de Claude Code) est déjà configuré avec le modèle adapté à sa mission. Voici les six modèles réellement utilisés dans notre stack :

ModèleRôleQuand l'utiliser
DeepSeek V4 FlashModèle principalConversations, rédaction, code, raisonnement — le couteau suisse, défaut sur les profils utilisateurs
MiniMax M3Spécialiste agenticJobs automatisés, cron exigeants, workflows multi-tours qui doivent tenir la trajectoire
GLM-5.2Agentic haut de gammeWorkflows agentic exigeants où M3 plafonne, sans passer au tarif Sonnet — agentique quasi-frontier (78) à prix contenu
Claude Sonnet 5Premium qualitéRédaction sensible, revue de code haut niveau, contenu client engageant — quand la qualité prime sur le coût
Claude Haiku 4.5RapideTâches rapides, classification, extraction, réponses temps réel — le meilleur rapport qualité/vitesse d'Anthropic
gpt-oss-120bScraping légerExtraction web, recherche simple, scraping, tâches en volume sans forte exigence de qualité

Tarification

Prix via OpenRouter, en dollars par million de tokens. Le cached input s'applique aux portions de contexte déjà vues sur des requêtes précédentes — très intéressant en agentic où les instructions et le contexte sont répétés.

ModèleInputOutputCached input
DeepSeek V4 Flash$0,0983$0,1966$0,0197
MiniMax M3$0,30$1,20$0,06
GLM-5.2$0,93$3,00$0,18
Claude Sonnet 5$2,00$10,00$0,20
Claude Haiku 4.5$1,00$5,00$0,0197
gpt-oss-120b$0,039$0,18

L'écart est massif : Claude Sonnet 5 coûte ~20× plus cher que DeepSeek V4 Flash en input et ~50× plus en output. C'est ce qui justifie le routage par usage — réserver Sonnet aux tâches où sa qualité fait la différence.


Benchmark comparatif

Trois axes pour comparer les modèles : Intelligence (raisonnement et connaissance générale), Coding (génération et compréhension de code), Agentic (capacité à enchaîner des tools et tenir une trajectoire sur plusieurs tours). DeepSeek V4 Flash est mis en avant — c'est le modèle principal du système.

Intelligence

V4 FlashM3GLM-5.2Sonnet 5Haiku 4.5gpt-oss

Coding

V4 FlashM3GLM-5.2Sonnet 5Haiku 4.5gpt-oss

Agentic

V4 FlashM3GLM-5.2Sonnet 5Haiku 4.5gpt-oss

Scores Artificial Analysis (Intelligence Index v4.1, SciCode, Terminal-Bench v2.1) — une seule méthodologie, couverture complète. Les performances réelles varient selon la tâche. Comparer sur OpenRouter →Benchmark complet →

Lecture : Sonnet 5 domine les trois axes (agentic 81, coding 54, intelligence 53). Juste derrière, GLM-5.2 s'impose comme le meilleur agentic non-premium (78, quasi-frontier) pour une fraction du prix de Sonnet — l'option idéale pour de l'autonomie exigeante à budget maîtrisé. MiniMax M3 (agentic 65) et V4 Flash (62) restent très compétitifs et bien moins chers. Haiku 4.5 se tient au milieu (agentic 44, cache le plus avantageux à $0,0197). gpt-oss-120b décroche (agentic 26) mais reste imbattable en coût sur les tâches en volume. À noter : le coding est resserré (39-54) — presque tous écrivent du code correct ; c'est l'agentic qui départage vraiment.


Ce que OpenRouter change

Sans agrégateur, nous devrions multiplier les abonnements, gérer une clé API par fournisseur, et espérer que le bon modèle soit disponible au bon moment.

Avec OpenRouter, un point d'entrée unique donne accès à tous ces modèles. DeepSeek, MiniMax, Anthropic, OpenAI — un seul fournisseur, une seule facture, et la liberté de choisir le meilleur rapport qualité/prix pour chaque tâche.

C'est la différence entre gérer une flotte de véhicules et prendre un taxi à la demande.