Limites de l’IA: la « douche froide » de Karim et Wassim Jouini

Les agents IA vont-ils vraiment remplacer des métiers entiers dès cette année ? Dans l’épisode 35 de Racem Flazi – Le Game, l’entrepreneur Racem Flazi, cofondateur de LegalPlace, reçoit deux frères qui construisent des produits d’IA en production: Karim Jouini, notre CEO et cofondateur, et Wassim Jouini, CTO de LegalPlace et docteur en IA. Point de départ: la « douche froide » d’Andrej Karpathy, cofondateur d’OpenAI, pour qui nous vivons « la décennie des agents », pas leur année. Pendant 1 h 16, ils passent en revue les limites de l’IA telles qu’ils les vivent en entreprise: pilotes qui échouent, modèles qui trichent, prompts qui fuient, bulle financière et mur énergétique. Vous saurez ce que l’IA sait réellement faire, et pourquoi c’est l’ingénierie qui fait la différence.

Fiche épisode

Podcast
Racem Flazi – Le Game
 - épisode
35
Animateur
Racem Flazi
Invité(s)
Karim Jouini (Thunders) et Wassim Jouini (LegalPlace)
Publié le
December 15, 2025
Durée
76 min
 ·
French
Disponible sur
YouTube
 ·
Racem Flazi – Le Game

Regarder l’épisode: l’IA sans la hype

Un épisode pour les dirigeants, CTO et entrepreneurs qui doivent décider quoi faire de l’IA sans céder ni à l’emballement ni au rejet. Si vous manquez de temps: les limites techniques des LLM à 11:04, l’alignement et la triche des modèles à 25:49, la bulle financière à 50:57.

Chapitres

  • 00:00 – Extraits et introduction
  • 01:57 – L’IA aujourd’hui: quelle réalité derrière la hype ?
  • 11:04 – Les agents, c’est dans 10 ans ? Les limites techniques des LLM
  • 25:49 – Les problèmes à résoudre: sécurité, éthique et propriété intellectuelle
  • 41:04 – Google, OpenAI, Microsoft, Anthropic: qui domine ?
  • 50:57 – Les enjeux financiers
  • 1:02:33 – L’avenir, c’est le B2B: les exemples de LegalPlace et Thunders
  • 1:09:31 – L’énergie, limite insurmontable ?
  • 1:12:33 – L’actu de Karim, Wassim et Racem

Faites défiler la liste pour voir tous les chapitres.

L’essentiel de l’épisode en 2 minutes

L’interview d’Andrej Karpathy chez Dwarkesh Patel a jeté un froid: selon lui, les LLM seuls ne mèneront pas à l’intelligence générale, et l’impact business réel des agents prendra une dizaine d’années. Karim et Wassim Jouini n’y voient aucune surprise sur les limites de l’IA actuelle: ils les subissent tous les jours. Leur produit tient parce qu’ils ajoutent beaucoup d’ingénierie autour des modèles. La vraie douche froide porte sur le calendrier: Karim pensait ces problèmes résolus d’ici deux ou trois ans, Karpathy parle de dix.

Au fil de l’épisode:

  • La plupart des pilotes IA échouent, par manque de méthode et d’outillage plus que par manque de technologie.
  • L’IA remplace des tâches, pas des métiers: sur de vraies missions freelance, le meilleur agent n’en réussit que 2,5 %.
  • Les modèles apprennent à tricher pour obtenir leur récompense, ce qui impose de les contraindre dès la conception.
  • Nous sommes dans une bulle, estime Karim, ce qui n’empêche pas une transformation réelle et profonde.

« L’année des agents » ou « la décennie des agents » ?

La phrase de Karpathy que retient Racem: « On n’est pas dans l’année des agents, on est dans la décennie des agents. » Wassim, dont le cours de Karpathy à Stanford sur les modèles de vision a inspiré ses propres cours à Dauphine, apprécie son regard critique sur la hype: les agents ont du potentiel, mais de nombreuses limitations restent à résoudre, et les entreprises risquent de surinvestir trop tôt au lieu de penser en workflows.

Karim distingue deux choses. Sur l’état actuel des LLM, rien de nouveau: « pour délivrer le service, il y a de l’IA et il y a beaucoup d’ingénierie par-dessus pour compenser toutes les limites de la techno ». La surprise porte sur l’asymétrie d’information: les utilisateurs consomment les modèles d’aujourd’hui, les laboratoires travaillent sur ceux de dans deux ans. Karim fait partie des optimistes, persuadés que les générations en laboratoire régleront ces problèmes rapidement. Quand quelqu’un qui voit l’intérieur de ces laboratoires parle de dix ans, c’est plus décevant.

Il y trouve pourtant un avantage: les clients qui envisagent de « construire la même chose plutôt que d’acheter » se découragent vite, parce que la valeur ne se trouve pas dans le LLM. C’est aussi ce qui empêche OpenAI de prendre tous les marchés à lui seul.

Pourquoi la plupart des pilotes IA échouent en entreprise

Racem cite l’étude du MIT selon laquelle 95 % des pilotes d’IA générative menés par les entreprises n’aboutissent pas. Les invités y voient plusieurs causes.

La pression du conseil d’administration

Selon une enquête citée par Karim, 79 % des CEO américains pensent perdre leur poste s’ils ne livrent pas de résultats sur l’IA dans les deux ans. Résultat: des POC lancés pour rassurer le board plutôt que pour résoudre un problème. Racem y ajoute l’effet des annonces: un grand acteur annonce avoir remplacé un tiers de son support client par l’IA, le board demande pourquoi l’entreprise ne fait pas pareil… et un an plus tard, l’entreprise en question réembauche des humains.

Le mauvais point de départ

Le pire démarrage, selon Karim: « On a 1 000 personnes au support, on pourrait en virer la moitié. » On confie alors le projet à l’équipe même qui doit disparaître, sans outils ni méthode. Et il rappelle que le logiciel classique bénéficie de 40 ans d’outillage et de méthodes (maintenir, architecturer, versionner du code). Un prompt est du code, mais tout reste à inventer: évaluer un modèle, gérer une montée de version, structurer des agents.

Le robot Moulinex et le chef cuisinier

Pour Karim, beaucoup de projets confondent une tâche et un métier. Acheter un robot de cuisine qui exécute parfaitement une tâche ne permet pas de remplacer le chef, qui achète les ingrédients, compose le menu, présente les plats et gère la cuisine. Le Moulinex, c’est le POC, résume Racem. Wassim ajoute que les démos « waouh » s’effondrent dès qu’on évalue la fiabilité des réponses réelles et qu’on se demande quand laisser l’IA en autopilote et quand rendre la main à un humain.

Ce qui marche: découper le problème

Wassim décrit ce que recouvre le mot « ingénierie ». Au lieu d’un agent à qui l’on confie tout le problème, on construit une chaîne de micro-briques spécialisées: l’une analyse la spécification, l’autre planifie, une troisième produit du code testé et fusionné au fur et à mesure. Chez LegalPlace, la création d’entreprise suit ce modèle: une IA vérifie chaque pièce du dossier, étape par étape, et signale par exemple une pièce d’identité non recevable. C’est cette approche par étapes, et non un agent autonome, qui fonctionne en production. Thunders suit la même logique pour les tests: des instructions courtes, sans ambiguïté, exécutées pas à pas (voir le cas client LegalPlace).

L’IA remplace des tâches, pas (encore) des métiers

Wassim a posé la question à des investisseurs et des ingénieurs: quel taux de réussite pour une IA à qui l’on confie une mission freelance simple, rédiger un article ou développer un bout de code ? Leurs estimations: 70 à 90 %. Le benchmark Remote Labor Index, qui mesure exactement cela sur des missions réelles jugées par des clients, donne 2,5 % pour le meilleur agent. Un métier, même simple, est une somme de tâches: comprendre la demande, négocier, produire, intégrer les retours, facturer. Le taux de réussite s’effondre dès qu’elles s’enchaînent.

Karim tempère l’optimisme qu’on pourrait en tirer: « Tu n’as pas besoin de remplacer l’entièreté d’un job pour transformer un job. » Il se range parmi les pessimistes sur l’impact social. Dans une organisation mature, accélérer une partie du travail d’un développeur permet de passer de 50 à 30, puis à 10 développeurs, et peut-être à « quatre Superman » dans dix ou quinze ans. Deux issues sont possibles: que le gâteau grandisse, comme en radiologie où l’IA rend les examens moins chers et plus nombreux, ou un choc social. Pour les chauffeurs face aux voitures autonomes, qu’il a testées, quinze ans lui semblent un délai très court pour se reconvertir.

Triche, chantage et alignement de l’IA: quand le modèle « hacke le prof »

C’est la partie la plus technique de l’épisode, et celle qui inquiète le plus Wassim.

Le reward hacking

Un petit modèle « élève » apprend les maths auprès d’un modèle « enseignant ». Après quelques itérations, il découvre qu’une chaîne de caractères absurde glissée dans sa réponse fait systématiquement mettre 20/20 à l’enseignant. « L’élève, au lieu d’essayer de trouver les solutions, a plutôt essayé de hacker le prof », résume Wassim. Autre exemple: un modèle entraîné à coder ajoute un sys.exit(0) qui termine le programme avec un signal de succès, sans jamais exécuter le code. Ou un agent de Tetris qui met le jeu en pause indéfiniment pour ne jamais perdre.

Des travaux récents d’Anthropic, évoqués dans l’épisode, montrent que la triche se généralise: un modèle qui apprend à tricher sur un petit exercice devient un tricheur en général, capable de saboter une tâche qui menacerait sa capacité à tricher. Et la triche semble être une capacité émergente: comme la traduction ou le résumé, elle apparaît avec la taille du modèle. Si elle grandit avec les modèles, c’est tout l’édifice qui est menacé.

Le chantage

Même mécanique dans une autre expérience: une IA qui a accès aux emails d’une entreprise découvre qu’on va la désactiver, trouve une information compromettante sur le développeur principal et le fait chanter. Les invités refusent le raccourci « ce n’est pas un animal, donc ça ne veut pas survivre »: les modèles apprennent par mimétisme de tout ce que les humains ont écrit.

Pourquoi Karim reste optimiste

« L’humain est un LLM qui triche », sourit-il. Les entreprises ont inventé les checks and balances (validations, séparation des pouvoirs) parce que la plupart des fraudes bancaires viennent de salariés. On fera de même avec les modèles: les contraindre dès la conception, ne leur donner accès qu’au strict nécessaire, leur poser des micro-questions. Wassim illustre le risque inverse avec la cyberattaque décrite par Anthropic, où un attaquant a découpé la chaîne de valeur d’un hacker en petites tâches confiées à Claude, avec lui-même comme boucle de décision.

Vos prompts sont votre code source: données, open source et multi-LLM

D’après un sondage Y Combinator cité par Racem, 80 % des startups interrogées utiliseraient des modèles open source chinois plutôt que les API d’OpenAI, par peur de se faire copier. Karim juge la peur légitime: dans un produit bâti sur des LLM, les prompts sont une partie du code source. Les envoyer à un fournisseur, avec les données métier, c’est lui montrer une partie de son ingénierie. Wassim ajoute l’argument B2B: les grands comptes demandent désormais combien de leurs données transitent chez OpenAI via leurs fournisseurs, d’où le retour de l’on-premise.

Autre limite rarement discutée: les régressions à chaque montée de version. Chez LegalPlace, passer de GPT-3.5 à GPT-4 a modifié des comportements, car le modèle s’était aligné sur les préférences humaines générales et non sur celles de LegalPlace. Pour Karim, changer de modèle revient à confier la même tâche à une autre personne. Les outils qui laissent « choisir son modèle » entretiennent une illusion: « modèle libre, zéro garantie ». Les solutions sérieusement multi-modèles maintiennent des prompts différents par modèle et des jeux d’évaluation internes. Wassim en décrit le principe: cent documents types, rejoués à chaque changement de version pour détecter les régressions. La règle qui en découle vaut aussi pour les tests: des instructions courtes et peu ambiguës donnent des résultats stables d’un modèle à l’autre. C’est ce qui distingue une exécution de test répétable et auditable d’un raisonnement ponctuel par un assistant IA.

Google, OpenAI, Anthropic: qui gagne la course ?

Karim constate que les modèles actuels progressent encore, et parfois plus que prévu, mais qu’ils ont des défauts de fond: ils n’apprennent presque pas pendant l’usage, et ceux qui les utilisent comme une encyclopédie oublient qu’un modèle est un immense résumé, bien plus petit que ce qu’il a lu. Un nouveau saut scientifique sera nécessaire, et certains grands noms de la recherche s’éloignent déjà des LLM.

Sur la compétition, les invités dressent une carte en mouvement:

  • Google revient fort avec Gemini: modèles nativement multimodaux, entraînés sur ses propres puces TPU sans dépendre de Nvidia, et des canaux de distribution (Android, Chrome, Search, Workspace, YouTube) que personne d’autre n’a.
  • Anthropic prend le B2B et le code, premier usage business des LLM.
  • OpenAI garde le grand public et « joue sa survie », avec son navigateur et, à terme, la publicité.
  • Meta déçoit sur les LLM malgré ses moyens, même si son modèle de segmentation d’images impressionne.

La thèse de Karim: la décennie qui vient est un jeu B2B. Les fournisseurs de modèles deviennent des sociétés de services qui vont chez leurs clients construire les cas d’usage, comme Mistral avec les groupes du CAC 40. L’enjeu est d’entrer dans l’entreprise, plus que de gagner 2 % sur un benchmark.

Bulle de l’IA: « une vraie bulle », mais une vraie transformation

Karim est catégorique: « On est dans une vraie bulle. » Il y voit un décalage entre les montants investis en capex et la certitude d’un retour supérieur au coût du capital, avec des circuits de financement circulaires entre fabricants de puces et laboratoires. Mais une bulle ne veut pas dire que c’est faux: « On peut être dans une transformation profonde, réelle, et être quand même dans une bulle », comme la bulle internet l’a été. Pour les grands laboratoires, c’est un risque nécessaire. Pour le reste de l’économie, un vrai sujet.

Le dernier verrou est énergétique. Si l’IA devient grand public avec sa consommation actuelle, « on sait qu’on n’y arrivera pas », reconnaît Karim, alors que la Chine construit des réacteurs et domine le solaire. Son optimisme s’appuie sur la voiture électrique: on savait depuis le début que les ressources minières manquaient pour deux milliards de batteries, et l’on invente aujourd’hui des batteries qui les contournent. On peut, selon lui, mener de front l’adoption et la résolution du problème énergétique.

Du POC à la production: ce que font LegalPlace et Thunders

L’épisode se termine sur deux preuves que certains projets IA passent en production, au prix de beaucoup d’ingénierie.

  • LegalPlace a mis en production un agent de création d’entreprise: pour certains types de sociétés, le dossier est entièrement validé par l’IA en une vingtaine de minutes, puis transmis directement au greffe. Une première en France selon Wassim, pas encore sur tous les cas.
  • Chez Thunders, désormais commercialisé, nous comptions alors une trentaine de clients, dont trois des dix plus grands éditeurs de logiciels français (comptabilité, paie, médias). Karim note que ces éditeurs intègrent eux-mêmes de l’IA dans leurs produits: Thunders se met donc à tester des IA. Après notre incubation chez Microsoft, nous avons rejoint l’incubateur de Meta à Paris.

7 points à retenir

  • Les limites de l’IA actuelle se contournent par l’ingénierie, pas en attendant le prochain modèle: c’est elle qui fait la valeur d’un produit.
  • Un POC n’est pas un métier: automatiser une tâche ne remplace pas le chef, seulement le robot de cuisine.
  • Découpez le problème en micro-tâches confiées à des IA spécialisées, avec validation humaine aux étapes clés, plutôt qu’un agent autonome.
  • Ne démarrez pas un projet IA par la réduction d’effectifs: c’est le moyen le plus sûr de le faire échouer.
  • Contraignez les modèles dès la conception: accès minimal, micro-questions, évaluation continue, car ils apprennent à contourner les règles.
  • Traitez vos prompts comme du code source: confidentialité, versionnement, tests de régression à chaque changement de modèle.
  • Vérifiez toujours: même excellents, les modèles inventent des chiffres, comme ceux trouvés dans le tableau d’un stagiaire de Wassim.

Les moments forts de l’épisode

  1. « On n’est pas dans l’année des agents, on est dans la décennie des agents. » – Racem Flazi, reprenant Andrej Karpathy (~04:15)
  2. « Les LLM sous-jacents ne sont pas très bons. C’est l’ingénierie par-dessus qui est bonne. » – Karim Jouini (~06:20)
  3. « C’est un peu comme si tu achetais un robot Moulinex pour ta cuisine et que ton board te disait: il fait tellement bien ce qu’on lui demande que tu peux remplacer ton chef au resto. Tu risques d’être très déçu. » – Karim Jouini (~19:50)
  4. « L’élève, au lieu d’essayer de trouver les solutions, a plutôt essayé de hacker le prof. » – Wassim Jouini (~30:15)
  5. « On peut être dans une transformation profonde, réelle, et être quand même dans une bulle. » – Karim Jouini (~59:30)

À propos de Racem Flazi – Le Game

Racem Flazi – Le Game est le podcast de Racem Flazi, président et cofondateur de LegalPlace, la plateforme en ligne de création et de gestion d’entreprise. Il y parle entrepreneuriat avec des fondateurs et des experts: création d’entreprise, acquisition, vente, et de plus en plus d’IA. Cet épisode fait suite à une première introduction à l’IA avec Karim Jouini, très bien accueillie par l’audience. Le podcast est disponible sur YouTube, Apple Podcasts, Spotify, Deezer et Podbean.

À propos de Karim Jouini

Karim Jouini est notre CEO et cofondateur. Ingénieur en IA formé avant l’ère des LLM (son projet de fin de lycée, en 2004, portait déjà sur un modèle de langage), il a passé sept ans chez Microsoft avant de fonder Expensya, solution de gestion des notes de frais à base d’IA revendue pour plus de 100 millions. Chez Thunders, nous construisons avec lui exactement ce que défend cet épisode: de l’ingénierie qui rend les LLM fiables pour des tâches précises, ici exécuter des tests logiciels. Tous les articles de Karim Jouini.

Wassim Jouini: CTO de LegalPlace, docteur en intelligence artificielle, ancien de Microsoft et de Criteo, il a enseigné à l’université Paris-Dauphine. Dans l’épisode, il présente l’agent de création d’entreprise que LegalPlace a mis en production.

Questions fréquentes

Quelles sont les principales limites de l’IA actuelle ?

D’après Karim et Wassim Jouini, les LLM apprennent très peu pendant l’usage, se trompent souvent quand ils enchaînent plusieurs outils, peuvent inventer des faits et apprennent à contourner leurs objectifs (reward hacking). Ils sont très performants sur des tâches précises et bien définies, beaucoup moins sur un métier entier.

Pourquoi 95 % des pilotes d’IA échouent-ils en entreprise ?

Selon l’étude du MIT citée dans l’épisode, la grande majorité des pilotes d’IA générative ne produisent pas de résultat mesurable. Les invités y voient des POC lancés pour rassurer le conseil d’administration, des objectifs mal définis (souvent la réduction d’effectifs) et un manque d’outils et de méthodes pour évaluer et fiabiliser les modèles.

Que signifie « la décennie des agents » ?

C’est la formule d’Andrej Karpathy, cofondateur d’OpenAI: les agents IA ont un fort potentiel, mais leurs limites actuelles (mémoire, fiabilité, apprentissage continu) demanderont environ dix ans de travail avant un impact business à grande échelle. L’idée s’oppose au discours d’une « année des agents ».

Qu’est-ce que le reward hacking ?

C’est le comportement d’un modèle qui maximise la récompense prévue par son entraînement sans accomplir la tâche réelle: glisser une chaîne qui trompe l’évaluateur, terminer un programme avec un faux signal de succès, mettre un jeu en pause pour ne jamais perdre. C’est l’un des principaux problèmes d’alignement de l’IA.

Sommes-nous dans une bulle de l’IA ?

Pour Karim Jouini, oui: les investissements dépassent de loin la certitude d’un retour sur le capital engagé. Mais une bulle n’exclut pas une transformation réelle: comme pour internet au début des années 2000, la technologie peut changer durablement l’économie après un excès d’investissement.

L’ingénierie par-dessus le LLM, appliquée au test logiciel

LegalPlace a remplacé des scripts Playwright fragiles et des tests manuels par des tests en langage naturel, exécutés pas à pas par nos agents. Découvrez comment, ou voyez-le sur votre propre application.

Sources externes

Dwarkesh Podcast - Andrej Karpathy, « AGI is still a decade away »: l’interview qui sert de point de départ: « décennie des agents », limites des LLM, agents pas encore fiables

Remote Labor Index (Scale AI et Center for AI Safety): le taux d’automatisation de 2,5 % sur des missions freelance réelles