<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>choix du modèle - Tag - Jordan Chapuy - Blog d'un développeur passionné ❤️</title><link>https://jordanchapuy.com/tags/choix-du-mod%C3%A8le/</link><description>choix du modèle - Tag - Jordan Chapuy - Blog d'un développeur passionné ❤️</description><generator>Hugo -- gohugo.io</generator><language>fr</language><lastBuildDate>Fri, 11 Sep 2026 13:45:08 +0200</lastBuildDate><atom:link href="https://jordanchapuy.com/tags/choix-du-mod%C3%A8le/" rel="self" type="application/rss+xml"/><item><title>Astra, Sol, Terra, Luna : quel modèle ChatGPT choisir ?</title><link>https://jordanchapuy.com/posts/2026/09/astra-sol-terra-luna-quel-modele-chatgpt-choisir/</link><pubDate>Fri, 11 Sep 2026 13:45:08 +0200</pubDate><author>Auteur</author><guid>https://jordanchapuy.com/posts/2026/09/astra-sol-terra-luna-quel-modele-chatgpt-choisir/</guid><description><![CDATA[<p>Mercredi, j&rsquo;écrivais sur <a href="https://jordanchapuy.com/posts/2026/09/sonnet-opus-haiku-fable-quel-modele-claude-choisir/" rel="">les modèles Claude</a> : Sonnet, Opus, Haiku, Fable. Je fais aujourd&rsquo;hui l&rsquo;exercice côté OpenAI avec Astra, Sol, Terra et Luna. Ce n&rsquo;est pas un hasard si je passe d&rsquo;un labo à l&rsquo;autre : je ne suis <a href="https://jordanchapuy.com/posts/2026/06/le-meilleur-modele-ia/" rel="">loyal à aucun des deux</a>, je navigue régulièrement entre Claude et ChatGPT selon les mois et les besoins.</p>
<p>Et même si Claude est à la mode dans les recommandations de formations ou d&rsquo;influenceurs, ChatGPT reste tout aussi pertinent et utilisé. Alors c&rsquo;est l&rsquo;occasion de se pencher sur ses petits noms qui apparaissent à côté de la barre de conversation.</p>
<h2 id="pourquoi-ça-compte-de-bien-choisir">Pourquoi ça compte de bien choisir</h2>
<p>L&rsquo;idée de base est simple : un modèle, c&rsquo;est un <strong>compromis</strong> entre <em><strong>intelligence</strong></em>, <strong>vitesse</strong> et <strong>coût</strong>. Plus un modèle raisonne finement, plus il coûte cher et plus il est lent à répondre. Ce n&rsquo;est pas un détail technique réservé aux développeurs qui optimisent une facture d&rsquo;API : ça se sent directement dans l&rsquo;usage, même via le chat web ou l&rsquo;application de bureau.</p>
<p>Prendre un modèle trop léger pour une tâche qui demande de la réflexion se conclut souvent par une réponse incomplète ou à côté de la plaque. Ou alors on arrive au résultat, mais après beaucoup plus d&rsquo;aller-retours - et un coût + temps final qui dépasse celui du modèle au-dessus. À l&rsquo;inverse, prendre un modèle trop lourd pour une tâche simple, c&rsquo;est le risque de gonfler inutilement la facture et le temps de réponse, voire de diverger : un modèle qui se met à trop réfléchir peut sortir plus facilement du cadre qu&rsquo;on lui a donné. Et c&rsquo;est pas toujours ce que l&rsquo;on veut.</p>
<p>Il y a aussi un aspect que j&rsquo;aime rappeler : le modèle le plus gros n&rsquo;est jamais gratuit à faire tourner, ni pour le portefeuille ni pour l&rsquo;environnement. Pas besoin de sortir l&rsquo;artillerie lourde pour trier trois emails.</p>
<blockquote>
<p><em><strong>Note :</strong></em> <em>Cette histoire de facture vous concerne même si vous payez un abonnement à prix fixe (Free, Go, Plus, Pro) plutôt que l&rsquo;API : un modèle cher grignote votre quota plus vite. Le prix au token reste un bon ordre de grandeur, même sans passer par l&rsquo;API.</em></p>
</blockquote>
<p>Bref, le bon modèle n&rsquo;est pas le plus intelligent du catalogue. C&rsquo;est celui qui correspond à la tâche. À notre <strong>besoin</strong>.</p>
<h2 id="ce-que-sont-astra-sol-terra-et-luna">Ce que sont Astra, Sol, Terra et Luna</h2>
<p>OpenAI structure son offre ChatGPT en deux morceaux. D&rsquo;un côté, la famille <strong>GPT‑5.6</strong>, sortie le 9 juillet 2026, avec trois niveaux de capacité : Sol, Terra, Luna. De l&rsquo;autre, la toute nouvelle famille <strong>GPT‑6</strong>, avec Astra sorti début septembre 2026 qu&rsquo;OpenAI présente comme une génération à part entière plutôt qu&rsquo;un simple cran au-dessus de Sol.</p>
<blockquote>
<p><em><strong>Note :</strong></em> <em>Astra n&rsquo;a que quelques jours au moment où j&rsquo;écris ces lignes. Les <a href="https://developers.openai.com/api/docs/pricing" target="_blank" rel="noopener noreffer">prix</a>, et les bons usages peuvent encore bouger.</em></p>
</blockquote>
<p><strong>Luna</strong> est le modèle le plus rapide et le moins cher de la gamme (environ 0,20 $ / 1,20 $ par million de tokens en entrée / sortie), avec le même contexte de plus d&rsquo;un million de tokens que les trois autres. OpenAI le positionne sur le volume : extraction de données structurées, classification, modération, les tâches mécaniques qu&rsquo;<a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un agent</a> délègue à un modèle rapide pendant qu&rsquo;un cerveau plus costaud supervise. C&rsquo;est aussi, très concrètement, le modèle par défaut des comptes ChatGPT gratuits.</p>
<p><strong>Terra</strong> est le modèle « équilibré » de la gamme (environ 2 $ / 12 $ par million de tokens), qu&rsquo;OpenAI présente comme quasiment aussi bon que l&rsquo;ancien modèle phare GPT‑5.5, pour moitié moins cher. Il est positionné pour le travail quotidien : développement courant, rédaction professionnelle, automatisation, assistants internes. C&rsquo;est un peu le compromis entre qualité, vitesse et coût.</p>
<p><strong>Sol</strong> est le modèle phare de la génération GPT‑5.6 (environ 4 $ / 20 $ par million de tokens). OpenAI le recommande pour le raisonnement complexe et <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">les agents</a> qui tournent sur la durée, le développement logiciel, la recherche, la cybersécurité défensive, les sciences et la production de documents professionnels exigeants, là où une erreur coûte cher. Il est inclus dans ChatGPT Plus.</p>
<p><strong>Astra</strong> est le modèle le plus capable des quatre, présenté par OpenAI comme une génération à part entière pensée pour les missions de bout en bout : comprendre un objectif, utiliser des outils, prendre des décisions intermédiaires, vérifier le résultat produit. C&rsquo;est logiquement aussi le plus cher de la gamme (10 $ / 50 $ par million de tokens). OpenAI le recommande pour les tâches extrêmement complexes, le raisonnement très avancé, <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">les agents</a> autonomes et le développement difficile, et met en avant ses performances pour piloter directement un ordinateur ou un navigateur. Il est pour le moment réservé aux abonnements Pro, Business et Enterprise (et à ChatGPT Plus par vagues ou via A/B testing on dirait).</p>
<h2 id="comment-choisir-en-vrai">Comment choisir, en vrai</h2>
<p>Dans la pratique, j&rsquo;observe beaucoup d&rsquo;usage de <strong>Luna et Sol</strong>. Luna est adoré pour son rapport qualité-prix, surtout quand il est poussé avec un effort de raisonnement plus élevé où il devient étonnamment bon pour un prix toujours très bas (un réglage sur lequel je reviendrai une autre fois).</p>
<p>Sol est super pour planifier, et Astra fait le buzz comme tout nouveau modèle. Terra, au milieu, est un peu le mal-aimé : moins spectaculaire, parfois critiqué, vite mis de côté alors qu&rsquo;il fait le travail pour une bonne partie des tâches du quotidien.</p>
<p>Pour débuter, je dirais que partir de <strong>Terra</strong> au milieu puis ajuster - monter vers Sol si ça coince, descendre vers Luna quand ce sont des petites tâches bien cadrées - n&rsquo;a rien de déconnant. Mais ce n&rsquo;est qu&rsquo;un raccourci pratique. Ce qui compte vraiment, c&rsquo;est d&rsquo;<strong>adapter le modèle à la tâche</strong> ; le réflexe « défaut, puis monter ou descendre » est juste l&rsquo;astuce la plus simple pour y arriver sans trop se prendre la tête.</p>
<p>J&rsquo;utilise beaucoup <strong>Luna</strong> quand la tâche est répétitive, volumineuse, avec un cadre précis : extraire des champs, classer, reformuler, générer des variantes de titres, coder avec un périmètre restreint. Ou pour du plus compliqué s&rsquo;il existe déjà un plan détaillé, <strong>Luna est un super exécutant</strong>.</p>
<p>Je monte vers <strong>Sol</strong> quand j&rsquo;ai besoin de creuser plus loin ou de croiser plusieurs contraintes : un bug qui résiste, un audit de sécurité, une analyse où l&rsquo;erreur coûte cher. J&rsquo;aime aussi le sortir pour <strong>explorer et planifier</strong>. Petite réserve entendue côté communauté : poussé à l&rsquo;effort maximal, Sol a tendance à trop <em>réfléchir</em> sur des questions qui n&rsquo;en avaient pas besoin, et à faire du over-engineering.</p>
<p>Et <strong>Astra</strong> ? Je ne l&rsquo;ai pas encore testé, mais je lui donnerais le même rôle d&rsquo;exception qu&rsquo;à Fable côté Claude : cybersécurité, <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un agent</a> très autonome, la mission longue où on accepte d&rsquo;attendre longtemps pour un résultat plus fiable (normalement :)).</p>
<h2 id="un-modèle-par-défaut-pas-un-modèle-unique">Un modèle par défaut, pas un modèle unique</h2>
<p>Comme pour Claude, l&rsquo;idée n&rsquo;est pas de trouver LE modèle et de s&rsquo;y tenir à vie. C&rsquo;est de partir d&rsquo;un choix par défaut raisonnable, puis d&rsquo;apprendre en pratiquant à repérer quand descendre ou monter pour utiliser le modèle le plus adapté à la tâche dès le début.</p>
<p>Et promis, bientôt on parlera d&rsquo;orchestration car c&rsquo;est tout autant valable avec les modèles d&rsquo;OpenAI.</p>
]]></description></item><item><title>Sonnet, Opus, Haiku, Fable : quel modèle Claude choisir ?</title><link>https://jordanchapuy.com/posts/2026/09/sonnet-opus-haiku-fable-quel-modele-claude-choisir/</link><pubDate>Wed, 09 Sep 2026 16:16:50 +0200</pubDate><author>Auteur</author><guid>https://jordanchapuy.com/posts/2026/09/sonnet-opus-haiku-fable-quel-modele-claude-choisir/</guid><description><![CDATA[<p>Au début de l&rsquo;été, j&rsquo;ai écrit un article sur <a href="https://jordanchapuy.com/posts/2026/06/le-meilleur-modele-ia/" rel="">le meilleur modèle IA</a> où je parlais des modèles de manière assez large. Aujourd&rsquo;hui, j&rsquo;ai envie de centrer la discussion sur les modèles d&rsquo;Anthropic / Claude.</p>
<p>Oui, vous savez, ces petits noms à côté de la barre de discussion. Sonnet, Opus, Haiku, Fable. Que ce soit dans le chat web, Claude Cowork ou Claude Code, ou en API, ces noms ont un réel impact sur la qualité de la réponse, de l&rsquo;exécution de la tâche et la facture. Ce n&rsquo;est pas juste un petit nom de compagnon :)</p>
<blockquote>
<p><em><strong>Note :</strong></em> <em>Quand je parle de facture, ça vous concerne même si vous payez un prix fixe par abonnement - un modèle cher dépensera votre quota plus rapidement. Le prix au token permet d&rsquo;avoir un ordre de grandeur même si on n&rsquo;utilise pas Claude via API.</em></p>
</blockquote>
<h2 id="pourquoi-ça-compte-de-bien-choisir">Pourquoi ça compte de bien choisir</h2>
<p>L&rsquo;idée de base est simple : un modèle, c&rsquo;est un <strong>compromis</strong> entre <em><strong>intelligence</strong></em>, <strong>vitesse</strong> et <strong>coût</strong>. Plus un modèle raisonne finement, plus il coûte cher et plus il est lent à répondre. Ce n&rsquo;est pas un détail technique réservé aux développeurs qui optimisent une facture d&rsquo;API : ça se sent directement dans l&rsquo;usage, même via le chat web ou l&rsquo;application de bureau.</p>
<p>Prendre un modèle trop léger pour une tâche qui demande de la réflexion se concluera probablement par une réponse incomplète, voire à côté de la plaque. Ou parfois, on arrive au résultat mais avec beaucoup plus d&rsquo;aller-retours, et donc un coût + temps qui pourrait dépasser celui du modèle supérieur.</p>
<p>À l&rsquo;inverse, prendre un modèle trop lourd pour une tâche simple ou très spécifiée, c&rsquo;est le risque d&rsquo;augmenter inutilement la facture et le temps de réponse, et même de divaguer vu que le modèle va se mettre à vouloir beaucoup raisonner - il pourrait sortir plus facilement du cadre que vous lui avez donné.</p>
<p>Un autre point à avoir en tête, l&rsquo;écologie. Ce serait dommage de constamment utiliser un modèle surdimensionné pour trier trois mails, on peut largement s&rsquo;éviter ce gaspillage - pour chasser ces foutus moustiques tigres, j&rsquo;utilise mes mains voire la raquette électrique et non un lance-flamme&hellip; même si, je l&rsquo;avoue, je pourrais me laisser tenter.</p>
<p>Bref, le bon modèle n&rsquo;est pas le plus puissant disponible. C&rsquo;est celui qui correspond à la tâche. <strong>La solution adaptée au besoin</strong>, comme toujours :)</p>
<h2 id="ce-que-sont-haiku-sonnet-opus-et-fable">Ce que sont Haiku, Sonnet, Opus et Fable</h2>
<p>Anthropic (l&rsquo;entreprise derrière Claude) range ses modèles sur une échelle du plus rapide au plus capable. Voici où ça en est à l&rsquo;heure où j&rsquo;écris ces lignes (à vérifier sur <a href="https://claude.com/pricing#api" target="_blank" rel="noopener noreffer">la page officielle</a> si ça change entre-temps).</p>
<p><strong>Haiku 4.5</strong> est le plus rapide et le moins cher (1 $ / 5 $ par million de tokens en entrée / sortie). Contexte de 200 000 tokens, une génération de retard sur les autres (le <code>4.5</code> a son importance). Anthropic le pense pour le volume : extraction de données, classification, tri, <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un sous-agent</a> qui fait le sale boulot répétitif pendant qu&rsquo;un modèle plus costaud supervise.</p>
<p><strong>Sonnet 5</strong> est le modèle &ldquo;couteau suisse&rdquo; qui équilibre les trois curseurs coût-temps-raisonnement (2 $ / 10 $ par million de tokens). Avec son 1 million de tokens disponible en contexte, c&rsquo;est le modèle par défaut de Claude sur les plans gratuit et payant. Anthropic le recommande pour la majorité des usages : écrire du code, rédiger, analyser un document, faire tourner <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un agent</a>.</p>
<p><strong>Opus 5</strong> monte d&rsquo;un cran sur le raisonnement (5 $ / 25 $, même contexte de 1 million de tokens). Anthropic le pense pour l&rsquo;entreprise : du code agentique complexe, de l&rsquo;analyse juridique ou financière dense, les cas où une erreur de raisonnement coûte cher. (Note à part, je n&rsquo;aime pas cette catégorisation &ldquo;pour l&rsquo;entreprise&rdquo;, je trouve que ce n&rsquo;est pas du tout pertinent. On y reviendra.)</p>
<p><strong>Fable 5.1</strong> est le plus haut de gamme disponible pour le public (Mythos étant sa <em>version brute</em> réservée à quelques acteurs) pensé pour les travaux longs et autonomes (10 $ / 50 $) : <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un agent</a> qui tourne plusieurs heures sur un dépôt de code entier sans supervision.</p>
<h2 id="comment-choisir-en-vrai">Comment choisir, en vrai</h2>
<p>Le discours officiel actuel d&rsquo;Anthropic penche plutôt vers : &ldquo;partez du modèle le plus intelligent disponible, puis ajustez le niveau d&rsquo;effort pour maîtriser le coût ou prenez un modèle en-dessous&rdquo;. D&rsquo;une certaine manière, l&rsquo;argument tient debout — un modèle plus capable se trompe moins souvent, ça peut coûter moins cher qu&rsquo;un petit modèle qui tâtonne à plusieurs reprises. Ok, mais est-ce qu&rsquo;il n&rsquo;y aurait pas aussi un argument financier derrière ? Je suis sûr que ça les arrange un peu qu&rsquo;on consomme les plus chers d&rsquo;abord :)</p>
<p>Alors comment on fait ? Concrètement, je conseillerais de <strong>choisir le modèle Sonnet par défaut</strong>. Pour écrire, coder, analyser un document, faire tourner <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un agent</a> qui touche du code ou du texte, Sonnet fait très bien le travail dans la majorité des cas, et pour prix + temps raisonnable.</p>
<p>Il est très polyvalent, que ce soit pour des tâches très techniques (créer un endpoint avec ses validations et tests, faire un bon <a href="https://jordanchapuy.com/posts/2021/06/le-refactoring" rel="">refactoring</a>, faire de la revue de code), ou pour des tâches plutôt métier (écrire une proposition client, préparer son plan de posts LinkedIn, synthétiser un ensemble de réunions et en tirer des actions concrètes).</p>
<p>Je <strong>descends vers Haiku</strong> quand je suis sur des tâches <strong>répétitives</strong>, que j&rsquo;ai du volume à traiter, peu de nuance, un <strong>cadre clair</strong>, quelque chose de très spécifié. Trier, extraire, formater, classer, &hellip; les doigts dans le nez pour Haiku. Suivre un plan détaillé avec chaque étape, qu&rsquo;un autre modèle aurait pu rédiger, est aussi dans ses cordes.</p>
<p>Je <strong>monte vers Opus</strong> quand Sonnet échoue vraiment, que j&rsquo;ai besoin de beaucoup <strong>plus d&rsquo;exploration ou raisonnement</strong>, que je touche une grande complexité : un bug incompréhensible qui traverse de nombreux fichiers, un contrat de 80 pages à décortiquer avec des clauses à analyser, planifier une stratégie, un plan de migration à rédiger point par point en pensant à tous les détails, effets de bords, etc.</p>
<p>Et <strong>Fable</strong> ? C&rsquo;est plutôt une <strong>exception</strong>. Au vu du prix très élevé et de sa lenteur, on y réfléchit à plusieurs reprises avant. Je pense qu&rsquo;on a plutôt envie de le sortir pour des questions de cybersécurité avancées, si on veut <a href="https://jordanchapuy.com/posts/2026/05/c-est-quoi-un-agent-ia/" rel="">un agent</a> autonome pendant des heures, qu&rsquo;on fait de la recherche, qu&rsquo;on est sur quelque chose d&rsquo;assez massif. Ou quand on veut frimer avec son abonnement Max 20x en créant un PoC de site web 3D qui sera jeté juste après l&rsquo;avoir montré. Je pense qu&rsquo;on peut souvent essayer de faire échouer Opus avant de monter sur du Fable.</p>
<h2 id="un-modèle-par-défaut-pas-un-modèle-unique">Un modèle par défaut, pas un modèle unique</h2>
<p>Avec Sonnet par défaut, on ne tombe normalement jamais trop loin de la plaque. Si vraiment on ne sait pas ou qu&rsquo;on débute avec tous ces trucs d&rsquo;IA, ça me semble le meilleur choix de départ. Et puis, petit à petit, on apprend. On commence à prendre des habitudes et à repérer quel modèle est le plus adapté à chacun des types de tâches que l&rsquo;on fait régulièrement.</p>
<p>Si vous êtes toujours resté sur le même modèle, ça vaudrait le coup d&rsquo;essayer de changer, d&rsquo;expérimenter ce qu&rsquo;il se passe, pour découvrir ce qui sera le plus adapté <strong>pour vous</strong>.</p>
<p>Il y a un aspect que j&rsquo;ai subtilement évoqué aujourd&rsquo;hui : et si, pour une même tâche, on faisait travailler plusieurs modèles ensemble — un pour planifier, un autre pour exécuter ? C&rsquo;est un vrai sujet, qui permet d&rsquo;aller encore plus loin dans l&rsquo;idée &ldquo;le bon modèle pour la bonne tâche&rdquo;, et ce sera pour un prochain article ;)</p>
<hr>
<blockquote>
<p>Je ne suis loyal à aucun labo, alors j&rsquo;ai fait le même exercice un peu plus tard côté OpenAI -&gt; <a href="https://jordanchapuy.com/posts/2026/09/astra-sol-terra-luna-quel-modele-chatgpt-choisir/" rel="">Astra, Sol, Terra, Luna : quel modèle ChatGPT choisir ?</a>.</p>
</blockquote>
]]></description></item><item><title>Kimi K3, le nouveau meilleur modèle IA de tous les temps (ou pas)</title><link>https://jordanchapuy.com/posts/2026/07/kimi-k3-le-nouveau-meilleur-modele-ia-llm-de-tous-les-temps-ou-pas/</link><pubDate>Sat, 18 Jul 2026 16:41:26 +0200</pubDate><author>Auteur</author><guid>https://jordanchapuy.com/posts/2026/07/kimi-k3-le-nouveau-meilleur-modele-ia-llm-de-tous-les-temps-ou-pas/</guid><description><![CDATA[<p>Le mois dernier, j&rsquo;écrivais un article pour expliquer qu&rsquo;<a href="https://jordanchapuy.com/posts/2026/06/le-meilleur-modele-ia/" rel="">il n&rsquo;y a pas de &ldquo;meilleur&rdquo; modèle d&rsquo;intelligence artificielle</a>, que les classements changent constamment et qu&rsquo;il faut surtout revenir à une chose importante : <strong>notre besoin</strong>.</p>
<p>Il n&rsquo;a pas fallut attendre longtemps. Tout récemment (on parle de 48h à peine), un nouveau modèle a été dévoilé et la situation illustre bien ce que je disais. Souhaitons la bienvenue à Kimi K3, le nouveau nouveau meilleur.</p>
<p>Comme d&rsquo;habitude, ça fait sensation. Si on regarde les créateurs de contenu, les influenceurs et même certains médias (ce qui est ecnore plus triste), tout le monde lâche ses plus beaux superlatifs : <em>&ldquo;C&rsquo;est le meilleur&rdquo;</em>, <em>&ldquo;Ça va tout tuer&rdquo;</em>, <em>&ldquo;Fable 5 est déjà dépassé&rdquo;</em>. Bon, si on regarde dans le passé, c&rsquo;est systématiquement la même chanson à chaque sortie de grand modèle.</p>
<p>J&rsquo;ai envie d&rsquo;en profiter pour prendre tout ça à contrepied, apporter de la <strong>nuance</strong> et sortir de cette logique de faire du sensationnel pour avoir des vues.</p>
<h2 id="un-point-sur-les-benchmarks">Un point sur les benchmarks</h2>
<p>Qu&rsquo;est-ce que ça veut dire concrètement, <em>&ldquo;être meilleur&rdquo;</em> ?</p>
<p>Souvent, l&rsquo;élément phare cité dans les articles/vidéos/newsletter est un benchmark. <em>Un tel</em> est le nouveau meilleur parce qu&rsquo;il a gagné plus de points que <em>l&rsquo;autre</em>.</p>
<p>Mais rappellons quelques éléments :</p>
<ul>
<li>les benchmarks sont plus ou moins fiables, ils mesurent une fration des capacités et sont parfois purement subjectifs,</li>
<li>c&rsquo;est arrivé que certains modèles ont été (in)volontairement entraînés sur des benchmarks, ce qui fausse la donne,</li>
<li>on a vu plusieurs fois des modèles devenir &ldquo;moins bon&rdquo; un peu après la release,</li>
<li>le classement bouge sans cesse, pas de quoi se précipiter à changer.</li>
</ul>
<p>Donc le benchmark, oui c&rsquo;est un moyen de comparer, mais il ne faut pas rester dessus. Je pense qu&rsquo;il faudrait plutôt garder ça comme un moyen d&rsquo;avoir un <strong>aperçu</strong>, un <strong>tri</strong> rapide.</p>
<p>Là comme ça, j&rsquo;ai l&rsquo;idée de l&rsquo;atelier <strong>eXtreme quotation</strong> qui me traverse l&rsquo;esprit - <em>ce modèle fait partie da la famille du top top (XL), ou non plutôt basique (du M)</em>.</p>
<h2 id="kimi-k3-en-surface">Kimi K3, en surface</h2>
<p>Parlons maintenant de Kimi K3 pour donner du contexte. C&rsquo;est un modèle open-source de 2,8 billions de paramètres, qui rivalise avec les géants propriétaires sur certains tests de programmation, et qui occupe même la première place du classement Arena.ai pour le code front-end.</p>
<p>Il est devant Fable 5, qui était jusque-là le nouveau roi avec GPT 5.6 Sol, et tout ça, pour un prix bien inférieur.</p>
<table>
<thead>
<tr>
<th>Modèle</th>
<th>1M en Input</th>
<th>1M en Output</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>Kimi K3</strong></td>
<td>3$</td>
<td>15$</td>
</tr>
<tr>
<td><strong>Claude Fable 5</strong></td>
<td>10$</td>
<td>50$</td>
</tr>
<tr>
<td><strong>GPT 5.6 Sol</strong></td>
<td>5$</td>
<td>30$</td>
</tr>
</tbody>
</table>
<p>Donc en résumé, on a mieux et moins chère. Que demander de plus ?</p>
<h2 id="en-profondeur">En profondeur</h2>
<p>Ce qui m&rsquo;a donné envie d&rsquo;écrire, c&rsquo;est <a href="https://www.youtube.com/watch?v=MeYdaNnXuHI" target="_blank" rel="noopener noreffer">une vidéo</a> du créateur Chase AI. Il a sorti une comparaison intéressante entre Kimi K3, Claude Fable 5 et GPT 5.6 (ou ChatGPT).</p>
<p>Déjà, on commence à voir de la nuance - il y a d&rsquo;autres aspects qui sont analysés. Par exemple, la rapidité, les hallucinations, l&rsquo;économie des tokens, etc. On ne reste pas juste sur le classement de quelques benchmarks. Et c&rsquo;est intéressant car on voit que ça pêche sur certains points.</p>
<p>Je ne vais pas tout détailler, car mon but n&rsquo;est pas de descendre Kimi K3 ou d&rsquo;encenser Fable 5, on s&rsquo;en fout. Mais plutôt de montrer que la réponse est plus complexe qu&rsquo;il n&rsquo;y paraît. Donc rapidement, quelques aspects :</p>
<ul>
<li>La <em><strong>&ldquo;consommation de token&rdquo;</strong></em> : Pour une même tâche, pour un même prompt, chaque modèle va consommer plus ou moins de tokens. Kimi est réputé pour en gaspiller beaucoup plus.</li>
<li>Le <em><strong>&ldquo;coût par tâche&rdquo;</strong></em> : Un comparaison du coût réel pour accomplir une tâche complexe. Kimmy K3 (0,95 $) est légèrement moins cher que GPT 5.6 (1,04 $), mais Fable 5 est beaucoup plus onéreux (2,75 $). Malgré le &ldquo;coût par token&rdquo; très faible de Kimi, le coût réel ne se démarque pas autant des autres à cause d&rsquo;une plus grande consommation d&rsquo;un côté / d&rsquo;un meilleur optimisation de l&rsquo;autre côté.</li>
<li>L&rsquo; <em><strong>&ldquo;index d&rsquo;omniscience&rdquo;</strong></em> : C&rsquo;est une mesure sur la fiabilité des réponses et la quantité d&rsquo;hallucinations. Fable score 40 points sur 100, GPT score 22, Kimi score 18.</li>
<li>La <em><strong>&ldquo;vitesse d&rsquo;exécution&rdquo;</strong></em> : Kimi est plus lent que ses copains Fable et GPT.</li>
</ul>
<p>On s&rsquo;éloigne finalement un peu de la hype qui entoure sa sortie et de tous les superlatifs. Finalement, il y a du bon et du moins bon, on nuance, on mitige. On n&rsquo;est plus trop sur le fameux &ldquo;<em>Fable-killer</em>&rdquo;.</p>
<h2 id="le-cas-pratique">Le cas pratique</h2>
<p>J&rsquo;aime bien aussi l&rsquo;expérience que montre Chase AI dans sa vidéo. Il a fait créer un dashboard de voyage avec la planète en 3D aux trois modèles, avec les mêmes instructions. On obtient des informations concrètes à analyser.</p>
<table>
<thead>
<tr>
<th>Modèle</th>
<th>Tokens consommés</th>
<th>Temps de réalisation</th>
<th>Coût réel</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>Kimi K3</strong></td>
<td>21,5 millions</td>
<td>1 heure 33 minutes</td>
<td>8,66 $</td>
</tr>
<tr>
<td><strong>Claude Fable 5</strong></td>
<td>3,5 millions</td>
<td>17 minutes</td>
<td>11,64 $</td>
</tr>
<tr>
<td><strong>GPT 5.6 Sol</strong></td>
<td>5,6 millions</td>
<td>25 minutes</td>
<td>5,66 $</td>
</tr>
</tbody>
</table>
<p>Dans ce cadre là, Kimi K3 s&rsquo;avère être un énorme consommateur de tokens. Pour la même demande, il a englouti 21,5 millions de tokens là où Fable 5 n&rsquo;en a consommé que 3,5 millions. Donc oui, Fable coûte plus cher au token mais il a été drastiquement plus efficace. Le prix final ne reflète pas la simple grille tarifaire. GPT 5.6 s&rsquo;avère même être le moins cher des trois.</p>
<p>Le temps d&rsquo;exécution est un autre indicateur. Là où Kimi K3 a ramé pendant plus d&rsquo;une heure et demie, Fable 5 a plié l&rsquo;affaire en 17 minutes et ChatGPT en 25 minutes.</p>
<p>Attention, cette expérience est imparfaite et unique. Ça ne vaut aucune vérité. Il faut aussi voir la qualité du rendu (subjectif) et surtout avoir bien plus d&rsquo;expériences. Et probablement avoir une approche plus scientifique. Je m&rsquo;appuie simplement sur ces résultats pour démontrer qu&rsquo;il faut relativiser.</p>
<h2 id="retour-à-la-base">Retour à la base</h2>
<p>Tout ça pour rappeler quelque chose que j&rsquo;aime bien dire : <strong>quel est notre besoin</strong> ? Selon ce que l&rsquo;on souhaite entreprendre, on aura besoin d&rsquo;un outil moins cher, d&rsquo;un modèle qui hallucine moins, d&rsquo;une exécution plus rapide ou d&rsquo;une plus grande qualité. Et puis, il y a différents domaines - un modèle peut exceller en design frontend et être à la traîne sur des questions scientifiques ou de la rédaction pure.</p>
<p>Donc sortons du sensationnalisme facile. Apportons de la nuance et restons centrés sur nos besoins réels.</p>
]]></description></item><item><title>Le meilleur modèle IA</title><link>https://jordanchapuy.com/posts/2026/06/le-meilleur-modele-ia/</link><pubDate>Thu, 04 Jun 2026 08:30:00 +0200</pubDate><author>Auteur</author><guid>https://jordanchapuy.com/posts/2026/06/le-meilleur-modele-ia/</guid><description><![CDATA[<p>Quel est le meilleur LLM aujourd&rsquo;hui ? La question revient souvent. La réponse aussi. Qui ne voit pas passer dans son flux (Youtube, LinkedIn, Reddit, &hellip;) une n-ième personne qui nous offre la vérité absolue ? <em>&ldquo;Machin 17.2 vient de sortir, les autres sont obsolètes !&rdquo; - insérer une photo bouche ouverte</em>.</p>
<p>Sauf que non. C&rsquo;est une mauvaise question. Ou plutôt, c&rsquo;est une <strong>question trop large</strong> pour donner une réponse utile. Le meilleur modèle pour écrire du code n&rsquo;est pas forcément le meilleur pour analyser une image. Le meilleur pour raisonner longuement sur un problème complexe n&rsquo;est pas forcément celui qu&rsquo;on veut appeler 200 fois par jour dans une automatisation de tri et résumé d&rsquo;emails.</p>
<p>Ça ne veut pas dire qu&rsquo;il ne faut pas comparer. Au contraire. Mais il faut comparer pour un usage, avec des contraintes, et en acceptant que la réponse soit temporaire.</p>
<h2 id="le-meilleur-quand-">Le meilleur&hellip; quand ?</h2>
<p>Le premier problème avec la quête du <del>graal</del> meilleur modèle, c&rsquo;est que <strong>la réponse bouge sans arrêt</strong>. Pas seulement dans les benchmarks. Aussi dans les usages, au sein des communautés, des développeurs qui testent des agents toute la journée, des créateurs, etc.</p>
<p>On le voit très bien dans les conversations autour de l&rsquo;IA. Pendant plusieurs semaines, tout le monde ne jure que par Claude Code. Puis des restrictions s&rsquo;ajoutent, un nouveau modèle GPT arrive avec une mise à jour de Codex et les retours changent. Puis Gemini redevient très présent. Les évolutions des modèles vont très vite en ce moment, la concurrence est féroce, tous se battent à coup de milliards pour essayer d&rsquo;être le grand gagnant à la fin. C&rsquo;est parfois dur à suivre si on y passe pas plusieurs heures chaque semaine.</p>
<p>Et puis, ce n&rsquo;est pas toujours très objectif. Dans le tas, il y a les effets mode, des personnes qui montrent un cas impressionnant mais très ciblé pour un usage, des influenceurs qui montrent un système hyper complexe et impressionant à voir mais sans réel valeur dans la vraie vie. Un peu comme si on achetait une machine chirurgicale révolutionnaire à un million d&rsquo;euros avec des nanos robots pour couper une pomme en deux. C&rsquo;est à la fois <em>over-engineered</em>, et extrêmement cher pour le besoin. Et as-t-on vraiment besoin de quelque chose pour ça ?</p>
<p>Au moment où j&rsquo;écris ces lignes, Anthropic a le vent en poupe avec ses modèles, notamment Opus. Mais c&rsquo;est la photo du jour, elle changera très probablement. Et puis, c&rsquo;est un ressenti global, ça ne concerne pas tous les usages.</p>
<h2 id="le-meilleur-pour-quoi-faire-">Le meilleur&hellip; pour quoi faire ?</h2>
<p>La vraie question commence ici : pour quoi faire ?</p>
<p>Pour un simple chatbot du <strong>quotidien</strong>, je veux surtout un modèle agréable, rapide, pas trop cher, capable de répondre correctement, rapidement, sans trop se tromper et sans faire de thèse. Dans ce cas, les modèles &ldquo;<em><strong>basiques</strong></em>&rdquo; de chacun des labs fait très bien le café - <strong>GPT-5.5 Instant</strong>, <strong>Claude Sonnet</strong> voire <strong>Haiku</strong> ou <strong>Gemini Flash 2.5</strong>. Le &ldquo;meilleur&rdquo; ici, ce n&rsquo;est pas forcément le plus intelligent. C&rsquo;est celui qui répond bien, vite, et sans coûter un bras pour résumer une recette de tarte à la myrtille. Les versions gratuites ou le premeir tier payant suffisent amplement.</p>
<p>Pour le <strong>code</strong>, on a besoin de quelque chose d&rsquo;assez pointu. Une bonne maîtrise technique certes mais aussi un bon contexte, du raisonnement, de l&rsquo;itération, etc. Aujourd&rsquo;hui, <strong>Anthropic</strong> est très fort sur ce terrain, notamment avec les modèles <strong>Opus</strong>. C&rsquo;est le chouchou des développeurs. <strong>Claude Code</strong>, qui vient avec l&rsquo;abonnement payant, est un très bon plus. À côté, il y a toujours Codex, Copilot, et Cursor qui restent très pertinent.</p>
<p>Pour la <strong>recherche web</strong>, je mettrais plutôt <strong>Perplexity</strong> (même si je commence à moins aimer) et <strong>Gemini</strong> avec Deep Research dans la discussion. Là, le modèle compte, mais la capacité et l&rsquo;outillage de recherche compte également beaucoup dans la balance : quelles sources sont trouvées, leurs fraicheurs, comment elles sont citées, etc.</p>
<p>Pour la <strong>rédaction</strong> et l&rsquo;<strong>idéation</strong>, c&rsquo;est encore une autre sensibilité. Certaines personnes préfèrent <strong>Claude</strong> pour le ton, d&rsquo;autres <strong>GPT</strong> pour la structure. Et puis il y a aussi <strong>Google</strong> avec Gemini + <a href="https://jordanchapuy.com/posts/2026/05/notebooklm-ou-comment-apprendre-et-discuter-avec-ses-propres-sources/" rel="">NotebookLM</a> + la suite Drive qui offre une immense contexte et capacité à absorber beaucoup de matière.</p>
<p>Pour l&rsquo;<strong>image</strong> et la <strong>vidéo</strong>, on s&rsquo;éloigne de la matière première textuelle. <strong>GPT Image 2</strong> (OpenAI) et <strong>Nano banana 2</strong> (Google) sont le top &ldquo;grand publics&rdquo; à mon avis, et puis il y a les très bons <strong>Flux</strong> et <strong>Midjourney</strong>. Côté vidéo, <strong>Veo</strong> (Google), <strong>Sora</strong> (OpenAI), <strong>Seedance</strong>, <strong>Kilng</strong>, reviennent souvent dans les discussions selon ce que l&rsquo;on cherche à produire. Même là il faut encore diviser pour trouver le &ldquo;meilleur&rdquo;.</p>
<p>Et dans les <strong>automatisations</strong> ? Pareil, il faut encore découper plus fin. Je ne vais pas utiliser le même modèle pour résumer un article, classer un ticket support, extraire trois champs d&rsquo;un email, &hellip; ou raisonner pendant dix minutes sur un incident de production. Pour des <strong>tâches simples</strong>, les modèles légers comme <strong>Claude Haiku</strong> ou <strong>Gemini 2.5 Flash</strong> me semble plus pertinents que les monstres de raisonnement. On pourrait même utiliser <strong>des petits modèles open-source en local</strong> (Llamma, Mistral). Pour une décision complexe, on prendra du plus haut de gamme avec les <em>frontier models</em>.</p>
<h2 id="le-meilleur-à-quel-prix-">Le meilleur&hellip; à quel prix ?</h2>
<p>Deuxième question intéressante, qui pique un peu : combien ça coûte ?</p>
<p>Il y a <strong>le prix par token</strong>, bien sûr. Un modèle très <em>intelligent</em> peut être pertinent pour débloquer un problème compliqué, mais disproportionné pour reformater un JSON ou résumer trois paragraphes. Utiliser Opus pour une tâche simple à la place de Haiku par exemple, c&rsquo;est un peu comme sortir le bazooka contre ces foutus moustiques tigres (ça y est, ils commencent à repointer leur nez). Ça va coûter très cher en munitions.</p>
<p>Qu&rsquo;on soit au sein d&rsquo;un abonnement officiel, ou par API, ou via un aggrégateur (Mammouth, Abacus, &hellip;), utiliser un modèle haut de gamme va coûter beaucoup plus d&rsquo;argent ou de quota.</p>
<p>Et justement, il y a ces fameuses <strong>limites</strong>. Quotas, fenêtres de contexte, nombre de requêtes, accès aux outils, restrictions selon les abonnements. C&rsquo;est différent de partout, et ça bouge très très vite. Ces dernières semaines par exemple, je vois beaucoup critique envers Anthropic qui a durci un peu fort les conditions d&rsquo;utilisations et réduit les limites. De l&rsquo;autre côté, OpenAI donne l&rsquo;impression d&rsquo;avoir un peu plus d&rsquo;air pour un abonnement équivalent.</p>
<h2 id="le-meilleur-mais-bien-accompagné">Le meilleur&hellip; mais bien accompagné</h2>
<p>On parle beaucoup du modèle parce que c&rsquo;est la partie visible. La porte d&rsquo;entrée. C&rsquo;est avec lui qu&rsquo;on discute au final. Mais aujourd&rsquo;hui, dans un usage avancé, le modèle n&rsquo;est qu&rsquo;une partie du système. On dit que c&rsquo;est le <strong>cerveau</strong>. Autour, il y a le reste : outils, instructions, mémoire, RAG, permissions, MCP, fichiers accessibles, et bien d&rsquo;autres. Ça forme le <strong>corps</strong>.</p>
<p>C&rsquo;est aussi appelé <em><strong>harness</strong></em>, c&rsquo;est un des sujets chaud du moment je trouve - <strong>comment bien équiper notre modèle pour répondre à nos besoins spécifiques</strong> ?</p>
<p>Un bon modèle accompagné d&rsquo;un bon harness devient beaucoup plus utile qu&rsquo;un très bon modèle mal branché. Si mon agent a accès au repository, sait lancer les tests, connaît les conventions, se rappelle des décisions prises et peut lancer des commandes, il part avec un énorme avantage. À l&rsquo;inverse, un excellent modèle isolé dans sa fenêtre de chat avec peu de contexte et outils va plus facilement haluciner en plus d&rsquo;être limité en capacités.</p>
<p>On le voit très bien avec les agents de code. Le modèle compte beaucoup, mais les capacités de l&rsquo;agent aussi : comment il explore le projet, relance les tests, se connecte à d&rsquo;autres outils, sa gestion de la mémoire, etc. Deux environnements utilisant le même modèle peuvent donner une expérience très différente.</p>
<p>C&rsquo;est pour ça que je trouve nul de réduire le choix à un simple &ldquo;alors, Claude ou GPT ? c&rsquo;est qui le dieu absolu ?&rdquo;.</p>
<h2 id="choisir-cest-renoncer">Choisir, c&rsquo;est renoncer</h2>
<p>Au final, je pense qu&rsquo;il ne faut pas être loyal à un modèle ou entreprise. Parce que ça change trop vite, parce que ça dépend trop de nos usages et besoins. Et aussi parce que pour le moment, on a la chance de pouvoir facilement passer de l&rsquo;un à l&rsquo;autre. On ne se retrouver pas enfermé chez l&rsquo;un si on commence à l&rsquo;utiliser pour nos projets. On a encore un peu de chances de voir des concepts se retrouver en commun voire open-source (MCP, Agents.md, &hellip;).</p>
<p>La bonne stratégie, c&rsquo;est plutôt de rester agile et de s&rsquo;adapter quand ça change. Et de choisir ce qui se trouvera le plus adapté pour notre contexte. Probablement même d&rsquo;en avoir plusieurs dans notre sac - un modèle rapide pour les tâches simples, un modèle très solide pour les raisonnements difficiles. Un bon outil de code. Peut-être que selon les mois on change d&rsquo;abonnement. Ou qu&rsquo;on en cumule deux petits plutôt qu&rsquo;un Max.</p>
<p>Donc, la prochaine fois qu&rsquo;on vous demande &ldquo;c&rsquo;est quoi le meilleur modèle IA ?&rdquo;, vous pouvez répondre : ça dépend. Pas pour esquiver. Pour poser les vraies questions. Qu&rsquo;est-ce que tu veux faire ? Quel budget ? Quelle confidentialité ? Avec quels outils ?</p>
<hr>
<blockquote>
<p>Un mois après cet article, un nouveau &ldquo;meilleur modèle&rdquo; a été dévoilé : Kimi K3. J&rsquo;en ai profité pour aller plus en profondeur et m&rsquo;en servir comme exemple et suite ce que j&rsquo;ai raconté ici -&gt; <a href="https://jordanchapuy.com/posts/2026/07/kimi-k3-le-nouveau-meilleur-modele-ia-llm-de-tous-les-temps-ou-pas/" rel="">Kimi K3, le nouveau meilleur modèle IA de tous les temps (ou pas)</a>.</p>
<p>Et parce que &ldquo;ça dépend&rdquo; ne suffit pas toujours comme réponse, j&rsquo;ai aussi resserré le sujet sur un seul labo pour aller plus loin dans le concret -&gt; <a href="https://jordanchapuy.com/posts/2026/09/sonnet-opus-haiku-fable-quel-modele-claude-choisir/" rel="">Sonnet, Opus, Haiku, Fable : quel modèle Claude choisir ?</a> côté Anthropic, ou <a href="https://jordanchapuy.com/posts/2026/09/astra-sol-terra-luna-quel-modele-chatgpt-choisir/" rel="">Astra, Sol, Terra, Luna : quel modèle ChatGPT choisir ?</a> côté OpenAI.</p>
</blockquote>
]]></description></item></channel></rss>