Dans le paysage dynamique de l'intelligence artificielle, l'émergence de nouveaux modèles est constante, mais rares sont ceux qui promettent autant que le dernier né de Mistral, le "Chonk". Thomas Rayrat et Christophe Vidal de Contrib. ont plongé au cœur de cette nouveauté en la soumettant à un banc d'essai impitoyable de 118 tâches inédites, loin des communiqués de presse habituels. Leur objectif : évaluer sans complaisance les performances de Mistral Large 4 face à une concurrence féroce, incluant Claude Opus et des modèles chinois comme DeepSeek, Qwen et Kimi, souvent moins médiatisés en Occident. Cette démarche s'inscrit dans une quête de transparence et d'évaluation pragmatique des capacités réelles de ces IA, au-delà du marketing.
L'enjeu est de taille, notamment pour l'IA souveraine européenne. Mistral se positionne comme un acteur clé, vantant des capacités exceptionnelles en cyberdéfense, industrie, finance, et une gestion impressionnante d'un million de tokens de mémoire. Mais ces promesses sont-elles tenues une fois mises à l'épreuve du réel ? Les fondateurs de Contrib. ont mis au point un protocole rigoureux pour simuler des usages variés et complexes, allant de la compréhension de documents géants à des scénarios bancaires ou industriels, sans oublier les aspects sensibles de censure et d'éthique, particulièrement pertinents pour les modèles chinois.
Le "Chonk" de Mistral : Un Nom qui Intrigue
Le surnom de "Chonk" pour Mistral Large 4 a piqué la curiosité. Au-delà de l'appellation, il s'agit de comprendre pourquoi Mistral choisit de se comparer spécifiquement aux modèles chinois. Est-ce une stratégie pour souligner son positionnement international ou une reconnaissance des avancées technologiques de ces acteurs orientaux ? Le test de Contrib. apporte des éclaircissements sur la pertinence de cette comparaison et révèle les forces et faiblesses de chaque modèle dans des contextes variés, loin des benchmarks synthétiques.
Ouvert ne Signifie pas Gratuit : La Réalité des Modèles Open-Source
L'épisode aborde un point crucial : la perception des modèles "ouverts". Beaucoup associent l'open-source à la gratuité, mais Thomas Rayrat et Christophe Vidal rappellent que si la "recette" est partagée, la "cuisine" — c'est-à-dire l'infrastructure, l'accès à l'API, ou l'ingénierie nécessaire pour l'exploiter — ne l'est pas toujours, ou du moins pas sans coûts. Cette nuance est fondamentale pour les entreprises et développeurs souhaitant intégrer ces technologies, car elle impacte directement les budgets et les stratégies d'adoption. L'épisode décortique les implications de cette distinction pour Mistral et ses concurrents.
Le Million de Tokens Promis : Une Capacité Réelle ou Théorique ?
La capacité de traiter un million de tokens est une prouesse technique annoncée par Mistral. Mais comme souvent en technologie, les spécifications théoriques peuvent différer de la réalité d'usage. Contrib. a mis cette affirmation à l'épreuve, confrontant le modèle à des documents massifs pour voir si l'API accepte réellement et traite efficacement une telle quantité d'informations. Cette vérification est cruciale pour les applications nécessitant une grande profondeur de contexte, comme l'analyse juridique ou la synthèse de rapports complexes.
Les Épreuves du Réel : Usine, Banquier, Dictée et Cyberdéfense
Le protocole de test ne se limite pas à des questions abstraites. Il inclut des scénarios concrets :
- L'usine : Gestion de processus complexes, résolution de problèmes industriels.
- Le banquier : Analyse financière, conformité réglementaire, interactions clients.
- La dictée : Test de précision et de compréhension linguistique, y compris les nuances et les pièges.
- La cyberdéfense : Capacité à identifier des menaces, analyser du code suspect, générer des réponses appropriées.
Ces épreuves révèlent les "erreurs qui font mal", c'est-à-dire celles qui pourraient avoir des conséquences significatives dans un cadre professionnel. Les bulletins de notes détaillés, disponibles sur le site de Contrib., offrent une vue sans filtre des performances de chaque IA.
Le Jeu et la Question de la Censure
L'épisode inclut un jeu interactif où les auditeurs peuvent tenter de reconnaître Mistral à l'aveugle parmi les réponses des autres IA, une façon ludique de souligner les particularités de chaque modèle. Mais au-delà du jeu, un segment crucial aborde les sujets sensibles comme Tiananmen, les Ouïghours et Xi Jinping. Cette section révèle quelles IA s'autocensurent et quelles sont les implications de cette censure, notamment pour les entreprises européennes qui déploient des modèles potentiellement bridés ou biaisés. Le cas de Qwen coupant sa réponse au mot "Xi Jinping" est particulièrement éloquent.
Avantages Compétitifs : Rapidité, Coût et Liberté de Parole
Thomas Rayrat et Christophe Vidal analysent les vrais avantages de Mistral. Est-ce sa rapidité d'exécution, son coût potentiellement inférieur, ou sa "liberté de parole" par rapport à des modèles plus enclins à la censure qui en fait un choix supérieur ? L'épisode explore si ces atouts suffisent à positionner Mistral comme le leader incontesté de l'IA souveraine européenne, tout en n'oubliant pas de mentionner le marketing géopolitique qui entoure souvent ces annonces.
Ce qu'il faut retenir
- Mistral Large 4 ("Le Chonk") a été soumis à 118 tâches inédites contre Claude Opus et des IA chinoises.
- La distinction entre modèle "ouvert" et "gratuit" est cruciale pour l'adoption en entreprise.
- La capacité d'un million de tokens de Mistral est testée sous de réelles conditions d'API.
- Les modèles chinois montrent des tendances à la censure sur des sujets politiques sensibles.
- Les tests soulignent l'importance de vérifier les performances réelles au-delà du marketing.
- Le podcast offre des éléments clés pour choisir le bon modèle IA pour vos projets.