<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Prompt on Thomas</title>
        <link>https://blog.thomasplantain.fr/tags/prompt/</link>
        <description>Recent content in Prompt on Thomas</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>fr-fr</language>
        <lastBuildDate>Sun, 02 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.thomasplantain.fr/tags/prompt/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Ollama en entreprise</title>
        <link>https://blog.thomasplantain.fr/post/ollama/</link>
        <pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate>
        
        <guid>https://blog.thomasplantain.fr/post/ollama/</guid>
        <description>&lt;img src="https://blog.thomasplantain.fr/img/ollama-entreprise.avif" alt="Featured image of post Ollama en entreprise" /&gt;&lt;h2 id=&#34;souveraineté-ia--pourquoi-déployer-ollama-sur-son-propre-réseau-interne-&#34;&gt;Souveraineté IA : Pourquoi déployer Ollama sur son propre réseau interne ?
&lt;/h2&gt;&lt;p&gt;Le risque majeur pour une entreprise aujourd&amp;rsquo;hui n&amp;rsquo;est pas l&amp;rsquo;absence d&amp;rsquo;IA, mais la &amp;ldquo;fuite de contexte&amp;rdquo;.&lt;/p&gt;
&lt;p&gt;Chaque fois qu&amp;rsquo;un employé colle un extrait de code propriétaire, un compte rendu financier ou une stratégie marketing dans un LLM cloud, ces données quittent le périmètre de sécurité de l&amp;rsquo;entreprise. Elles deviennent, potentiellement, la matière première pour l&amp;rsquo;entraînement des futures versions du modèle. Pour une DSI, c&amp;rsquo;est un cauchemar de compliance.&lt;/p&gt;
&lt;p&gt;La solution n&amp;rsquo;est pas d&amp;rsquo;interdire l&amp;rsquo;IA — ce qui serait contre-productif — mais de déplacer le moteur. C&amp;rsquo;est là qu&amp;rsquo;intervient le déploiement d&amp;rsquo;un serveur &lt;strong&gt;Ollama&lt;/strong&gt; sur le réseau interne.&lt;/p&gt;
&lt;h3 id=&#34;le-contrôle-total--au-delà-de-la-confidentialité&#34;&gt;Le contrôle total : Au-delà de la confidentialité
&lt;/h3&gt;&lt;p&gt;Installer Ollama sur un serveur d&amp;rsquo;entreprise, ce n&amp;rsquo;est pas simplement &amp;ldquo;faire tourner un modèle&amp;rdquo;, c&amp;rsquo;est reprendre la main sur trois piliers critiques :&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;1. L&amp;rsquo;étanchéité des données (Air-gapping)&lt;/strong&gt;
L&amp;rsquo;avantage premier est mathématique : si le serveur n&amp;rsquo;a pas d&amp;rsquo;accès sortant vers le fournisseur de LLM, la donnée ne sort pas. Les documents confidentiels et les données clients restent sur vos propres disques, derrière vos propres pare-feu. Le risque de fuite vers un cloud tiers est réduit à zéro.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. La fin de la &amp;ldquo;taxe au token&amp;rdquo;&lt;/strong&gt;
Le modèle de facturation au token des API cloud est imprévisible. Avec un serveur Ollama, le coût est fixe : c&amp;rsquo;est le prix du matériel et de l&amp;rsquo;électricité. L&amp;rsquo;entreprise repasse d&amp;rsquo;un coût opérationnel variable (OpEx) à un investissement matériel maîtrisé (CapEx).&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3. La latence et la disponibilité&lt;/strong&gt;
Dépendre d&amp;rsquo;une API externe, c&amp;rsquo;est accepter des temps de réponse variables et des risques de panne globale. Un serveur local offre une latence stable et une disponibilité totale, même en cas de coupure internet.&lt;/p&gt;
&lt;h3 id=&#34;léquation-technique--gpu-vram-et-performance&#34;&gt;L&amp;rsquo;équation technique : GPU, VRAM et performance
&lt;/h3&gt;&lt;p&gt;Le déploiement d&amp;rsquo;un serveur Ollama est avant tout une question de gestion de la mémoire vidéo (VRAM). Pour qu&amp;rsquo;un LLM soit rapide, il doit être chargé entièrement dans la mémoire du GPU. Si le modèle dépasse la capacité de la VRAM, le système bascule sur la RAM classique (CPU), et la vitesse de génération s&amp;rsquo;effondre.&lt;/p&gt;
&lt;h3 id=&#34;lalternative-apple-silicon--le-mac-studio-comme-serveur-dia&#34;&gt;L&amp;rsquo;alternative Apple Silicon : Le Mac Studio comme serveur d&amp;rsquo;IA
&lt;/h3&gt;&lt;p&gt;Le Mac Studio (M2 Ultra ou M3 Ultra) propose une approche radicalement différente grâce à l&amp;rsquo;&lt;strong&gt;Unified Memory Architecture (UMA)&lt;/strong&gt;. Contrairement à un PC où la VRAM est limitée à la carte graphique, le Mac Studio permet au GPU d&amp;rsquo;accéder à la quasi-totalité de la RAM système.&lt;/p&gt;
&lt;p&gt;Si vous avez un Mac Studio avec &lt;strong&gt;192 Go de RAM&lt;/strong&gt;, vous pouvez charger des modèles massifs (comme un Llama 3 70B) que même une RTX 4090 ne pourrait pas ouvrir sans crash. Le GPU &amp;ldquo;voit&amp;rdquo; la RAM système comme de la VRAM. C&amp;rsquo;est la solution &amp;ldquo;Plug &amp;amp; Play&amp;rdquo; idéale pour ceux qui veulent de la puissance sans gérer un cluster de serveurs bruyants.&lt;/p&gt;
&lt;h3 id=&#34;choisir-son-modèle--ne-pas-viser-le-plus-gros&#34;&gt;Choisir son modèle : Ne pas viser &amp;ldquo;le plus gros&amp;rdquo;
&lt;/h3&gt;&lt;p&gt;En entreprise, la pertinence prime sur la taille.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Modèles &amp;ldquo;Lightweight&amp;rdquo; :&lt;/strong&gt; Idéaux pour la routine : résumé de mails, classification de tickets. Rapides et économes.
&lt;ul&gt;
&lt;li&gt;gemma4:e2b&lt;/li&gt;
&lt;li&gt;qwen3.5:4b&lt;/li&gt;
&lt;li&gt;lfm2.5-2.6b&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Modèles &amp;ldquo;Reasoning&amp;rdquo; :&lt;/strong&gt; À réserver aux tâches complexes : analyse de contrats, architecture logicielle. Ils demandent beaucoup plus de VRAM (40 Go+).
&lt;ul&gt;
&lt;li&gt;gemma4:31b&lt;/li&gt;
&lt;li&gt;qwen3.5:35b&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Modèles spécialisés :&lt;/strong&gt; Pour assister les développeurs sans envoyer le code sur un cloud tiers.
&lt;ul&gt;
&lt;li&gt;codellama:34b&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;valider-la-performance--le-test-systématique-avec-promptfoo&#34;&gt;Valider la performance : Le test systématique avec Promptfoo
&lt;/h3&gt;&lt;p&gt;Comment s&amp;rsquo;assurer qu&amp;rsquo;un modèle local est aussi précis que GPT-4 sur vos données ? Tester &amp;ldquo;à la main&amp;rdquo; quelques prompts est une loterie. Pour lever l&amp;rsquo;incertitude, j&amp;rsquo;utilise &lt;strong&gt;Promptfoo&lt;/strong&gt; (voir post précédent).&lt;/p&gt;
&lt;p&gt;C&amp;rsquo;est un outil d&amp;rsquo;évaluation qui permet de comparer systématiquement plusieurs modèles sur un même jeu de données. On injecte 50 questions types de l&amp;rsquo;entreprise et on compare côte à côte les réponses des LLMs qui tournent sur Ollama et de l&amp;rsquo;API OpenAI.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;approche est rigoureuse :&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Tests de régression :&lt;/strong&gt; Vérifier qu&amp;rsquo;une mise à jour de modèle ne dégrade pas la qualité.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Score de précision :&lt;/strong&gt; Utiliser un LLM &amp;ldquo;juge&amp;rdquo; pour noter la pertinence des réponses.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Optimisation :&lt;/strong&gt; Identifier le prompt qui fonctionne le mieux pour chaque modèle spécifique.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;gouvernance--du-serveur-au-poste-de-travail&#34;&gt;Gouvernance : Du serveur au poste de travail
&lt;/h3&gt;&lt;p&gt;Pour éviter que le serveur ne devienne un chaos, l&amp;rsquo;installation d&amp;rsquo;une interface comme &lt;strong&gt;Open WebUI&lt;/strong&gt; est indispensable. Elle apporte une couche de gouvernance nécessaire :&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Gestion des accès :&lt;/strong&gt; Contrôler qui utilise quel modèle.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Historique partagé :&lt;/strong&gt; Créer des bibliothèques de prompts optimisés pour les tâches métiers.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Sécurité :&lt;/strong&gt; L&amp;rsquo;utilisateur final n&amp;rsquo;accède qu&amp;rsquo;à l&amp;rsquo;interface de chat, jamais au système de fichiers du serveur.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;conclusion--la-souveraineté-comme-avantage-compétitif&#34;&gt;Conclusion : La souveraineté comme avantage compétitif
&lt;/h2&gt;&lt;p&gt;L&amp;rsquo;époque où l&amp;rsquo;IA était réservée aux géants du cloud est terminée. Aujourd&amp;rsquo;hui, une entreprise peut déployer son propre cerveau numérique sur un Mac Studio ou un serveur Linux avec Ollama, et reprendre le contrôle total de ses données.&lt;/p&gt;
&lt;p&gt;Le passage au local n&amp;rsquo;est pas un retour en arrière technologique, c&amp;rsquo;est une stratégie de maturité. C&amp;rsquo;est choisir la &lt;strong&gt;confidentialité&lt;/strong&gt; plutôt que la commodité, et la &lt;strong&gt;stabilité des coûts&lt;/strong&gt; plutôt que la dépendance aux abonnements. En combinant Ollama, Open WebUI et la rigueur d&amp;rsquo;un testing via Promptfoo, l&amp;rsquo;entreprise ne se contente pas d&amp;rsquo;utiliser l&amp;rsquo;IA : elle la possède.&lt;/p&gt;
</description>
        </item>
        <item>
        <title>Promptfoo - Testez vos LLMs</title>
        <link>https://blog.thomasplantain.fr/post/promptfoo/</link>
        <pubDate>Sun, 12 Jul 2026 00:00:00 +0000</pubDate>
        
        <guid>https://blog.thomasplantain.fr/post/promptfoo/</guid>
        <description>&lt;img src="https://blog.thomasplantain.fr/img/promptfoo-header.avif" alt="Featured image of post Promptfoo - Testez vos LLMs" /&gt;&lt;h2 id=&#34;stop-au-vibe-check--benchmarker-ses-llms-systématiquement-avec-promptfoo&#34;&gt;Stop au &amp;ldquo;Vibe Check&amp;rdquo; : Benchmarker ses LLMs systématiquement avec Promptfoo
&lt;/h2&gt;&lt;p&gt;Le &amp;ldquo;vibe check&amp;rdquo; est l&amp;rsquo;ennemi du déploiement stable.&lt;/p&gt;
&lt;p&gt;Quand on passe d&amp;rsquo;un modèle à un autre (par exemple de GPT-4o à Claude 3.5 Sonnet) ou qu&amp;rsquo;on ajuste un prompt système, on a l&amp;rsquo;impression que &amp;ldquo;ça marche toujours&amp;rdquo;. Mais sans métriques, on ne sait pas si on a corrigé un bug dans un coin tout en créant une régression majeure ailleurs.&lt;/p&gt;
&lt;p&gt;Pour sortir de l&amp;rsquo;intuition, j&amp;rsquo;utilise &lt;strong&gt;promptfoo&lt;/strong&gt;. C&amp;rsquo;est un outil CLI qui permet de tester des prompts sur plusieurs modèles en parallèle et de valider les sorties via des assertions.&lt;/p&gt;
&lt;p&gt;Voici la méthode pour monter un benchmark robuste en moins de 30 minutes.&lt;/p&gt;
&lt;h2 id=&#34;1-la-stratégie--le-framework-dexpertise-multi-dimensionnel&#34;&gt;1. La stratégie : Le Framework d&amp;rsquo;Expertise Multi-Dimensionnel
&lt;/h2&gt;&lt;p&gt;L&amp;rsquo;erreur classique est de créer une liste plate de questions. Pour un benchmark qui a du sens, il faut segmenter par &lt;strong&gt;domaines d&amp;rsquo;expertise&lt;/strong&gt; et par &lt;strong&gt;niveaux de difficulté&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;Je divise mes tests en trois paliers :&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;L1 (Baseline) :&lt;/strong&gt; Tâches standards. On vérifie que le modèle connaît la base.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;L2 (Stress) :&lt;/strong&gt; Contraintes complexes ou demandes contre-intuitives. On teste la capacité d&amp;rsquo;application.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;L3 (Edge) :&lt;/strong&gt; Cas limites, paradoxes ou contraintes extrêmes (ex: lipogrammes). On cherche le point de rupture.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Pour chaque domaine (Coding, Raisonnement, Rédaction), je crée un jeu de données qui suit cette progression.&lt;/p&gt;
&lt;h2 id=&#34;2-la-plomberie--architecture-des-fichiers&#34;&gt;2. La plomberie : Architecture des fichiers
&lt;/h2&gt;&lt;p&gt;L&amp;rsquo;idée est de séparer la configuration (le &amp;ldquo;comment&amp;rdquo;) des données (le &amp;ldquo;quoi&amp;rdquo;).&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;La structure :&lt;/strong&gt;&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;benchmark/
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;├── promptfooconfig.yaml   # Configuration des modèles et prompts
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;└── tests/
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    ├── software_engineering.csv  # Données de test domaine A
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;    └── complex_reasoning.csv     # Données de test domaine B
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Dans les fichiers CSV, j&amp;rsquo;utilise des colonnes &lt;code&gt;expertise&lt;/code&gt;, &lt;code&gt;prompt&lt;/code&gt; et &lt;code&gt;assert&lt;/code&gt;. Promptfoo injecte automatiquement ces variables dans le template de prompt.&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;&#34;&gt;&lt;code class=&#34;language-csv&#34; data-lang=&#34;csv&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#e6db74&#34;&gt;expertise&lt;/span&gt;,&lt;span style=&#34;color:#e6db74&#34;&gt;prompt&lt;/span&gt;,&lt;span style=&#34;color:#e6db74&#34;&gt;assert&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#e6db74&#34;&gt;Software Engineering&lt;/span&gt;,&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;Implement a function in Python to find the first non-repeating character in a string. Return the index.&amp;#34;&lt;/span&gt;,&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;contains(&amp;#39;O(n)&amp;#39;)&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#e6db74&#34;&gt;Software Engineering&lt;/span&gt;,&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;Create a JSON schema for a &amp;#39;Book&amp;#39; object that includes title, author, ISBN-13, and a list of genres.&amp;#34;&lt;/span&gt;,&lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;contains(&amp;#39;ISBN-13&amp;#39;)&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id=&#34;3-implémentation-technique&#34;&gt;3. Implémentation technique
&lt;/h2&gt;&lt;p&gt;Voici le cœur du système. Le fichier &lt;code&gt;promptfooconfig.yaml&lt;/code&gt; définit le template et les providers.&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;&#34;&gt;&lt;code class=&#34;language-yaml&#34; data-lang=&#34;yaml&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#f92672&#34;&gt;prompts&lt;/span&gt;:
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  - &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;You are a world-class expert in {{expertise}}. Please provide a professional response to: {{prompt}}&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#f92672&#34;&gt;providers&lt;/span&gt;:
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  - &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;ollama:chat:oamazonasgabriel/lfm2.5-2.6b:q4_k_m-8gbGPU&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  - &lt;span style=&#34;color:#e6db74&#34;&gt;&amp;#34;ollama:chat:qwen3.5:4b&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#f92672&#34;&gt;tests&lt;/span&gt;:
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  - &lt;span style=&#34;color:#ae81ff&#34;&gt;tests/software_engineering.csv&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;  - &lt;span style=&#34;color:#ae81ff&#34;&gt;tests/complex_reasoning.csv&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;strong&gt;Le secret des assertions :&lt;/strong&gt;
Ne vous contentez pas de vérifier si un mot est présent (&lt;code&gt;contains&lt;/code&gt;). Pour les niveaux L2 et L3, utilisez le &lt;code&gt;llm-rubric&lt;/code&gt;. C&amp;rsquo;est un &amp;ldquo;modèle juge&amp;rdquo; qui évalue la réponse selon des critères précis.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Exemple d&amp;rsquo;assertion pour un test de code L3 :&lt;/em&gt;
&lt;code&gt;llm-rubric: &amp;quot;La réponse doit utiliser std::atomic, gérer le problème ABA et ne contenir aucun mutex.&amp;quot;&lt;/code&gt;&lt;/p&gt;
&lt;h2 id=&#34;4-exécution-et-analyse&#34;&gt;4. Exécution et Analyse
&lt;/h2&gt;&lt;p&gt;Le workflow est simple :&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;code&gt;promptfoo eval&lt;/code&gt; : Lance tous les tests sur tous les modèles.&lt;/li&gt;
&lt;li&gt;&lt;code&gt;promptfoo view&lt;/code&gt; : Ouvre une interface web.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;L&amp;rsquo;interface affiche un tableau comparatif. En un coup d&amp;rsquo;œil, on voit quel modèle échoue sur les cas L3 et lequel est le plus stable sur les L1. C&amp;rsquo;est là que le choix du modèle devient une décision d&amp;rsquo;ingénierie et non une préférence personnelle.&lt;/p&gt;
&lt;h2 id=&#34;conclusion&#34;&gt;Conclusion
&lt;/h2&gt;&lt;p&gt;Passer du &amp;ldquo;je pense que ça marche&amp;rdquo; au &amp;ldquo;ce modèle a un score de 85% sur mon jeu de test L2&amp;rdquo; change totalement la manière de construire des produits AI. Le benchmark n&amp;rsquo;est pas une étape finale, c&amp;rsquo;est un garde-fou permanent.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Idée de prochaine étape :&lt;/strong&gt; Intégrer ce benchmark dans une CI/CD pour bloquer tout déploiement si le score de régression dépasse 5%.&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
