Décryptage Société

Faut-il croire les annonces des géants de l'IA ?

Cet été 2026, OpenAI et Anthropic ont annoncé des percées en mathématiques et en cybersécurité. Les résultats existent souvent, mais l'annonce en élargit la portée, ramenée à sa taille réelle par un tiers indépendant.

📅 27 septembre 2026 🔗 25 sources citées Par
Pavillon d'un mégaphone de verre dont s'échappe un faisceau de lumière ambrée qui se dissout dans l'obscurité.

Cet été 2026, deux laboratoires d'IA ont revendiqué des percées en mathématiques et en cybersécurité, deux chercheuses en éthique de l'IA ont dénoncé publiquement ce battage et des mathématiciens de premier plan, dont 25 médaillés Fields, ont signé une déclaration collective sur le sujet. Ce décryptage ne tranche pas entre ces trois voix : il vérifie, cas par cas, ce qui reste d'une annonce une fois qu'un tiers a pu la rejouer et ce que ça change pour l'entreprise qui choisit un outil IA sur la foi d'un communiqué.

Le 8 septembre 2026, OpenAI annonce une preuve résolvant une variante des équations de Navier-Stokes ; le Clay Mathematics Institute écrit le 11 septembre que le problème « a apparemment été réglé », avant qu'un mathématicien de l'université de Chicago ne rappelle que le problème principal reste ouvert. Ce décryptage examine cinq annonces de laboratoires d'IA de l'été 2026, en mathématiques et en cybersécurité, à partir de la déclaration mathématique du 11 septembre 2026 et de données publiées par les laboratoires eux-mêmes, dont les 26 153 candidats de vulnérabilité recensés par Anthropic pour Claude Mythos. Nous montrons que le résultat existe presque toujours, mais que sa portée réelle n'apparaît qu'une fois vérifiée par un mathématicien, un chercheur en sécurité ou une institution publique distincte du laboratoire. Le cadre juridique européen sur la responsabilité, lui, a reculé sur ce point précis.

En bref

Une annonce de percée IA désigne une communication d'un laboratoire sur les capacités de son propre modèle, avant toute vérification indépendante. Elle se lit à trois niveaux : ce qui est annoncé, ce que le laboratoire mesure lui-même et ce qu'un tiers confirme ensuite. Cet été 2026, en mathématiques et en cybersécurité, les trois niveaux ont rarement coïncidé.

4 cas

Trois étages de preuve, cas par cas

Ce qu'un laboratoire annonce, ce qu'il mesure lui-même, ce qu'un tiers a pu vérifier.

Sources et dates indiquées dans chaque case. Relevés au 27 septembre 2026.

Que reste-t-il des percées annoncées cet été, une fois examinées ?

Cinq annonces ou incidents de laboratoires d'IA ont marqué l'été 2026, en mathématiques et en cybersécurité. Aucune de ces annonces n'est inventée : dans chaque cas, quelque chose de réel existe. Ce qui bouge, à chaque fois, c'est l'écart entre ce résultat et la portée que l'annonce lui donne. La déclaration de Leiden sur l'IA et les mathématiques, publiée en juin 2026 par un groupe de travail international de quinze personnes et signée par plus de 150 professeurs à sa publication, le formule sans détour : « il existe actuellement une forte incitation commerciale, de la part de l'industrie technologique, à surestimer les capacités de ses produits. » Le sujet n'est donc pas de savoir si ces modèles sont utiles. Ils le sont. Le sujet est de savoir ce qui reste d'une annonce une fois qu'elle passe entre les mains de quelqu'un d'autre que celui qui l'a faite.

Premier cas, la portée. Le 8 septembre 2026, OpenAI annonce qu'un système multi-agents, mobilisant selon ses propres chiffres de l'ordre de 10 000 agents simultanés sur environ 88 heures pour 2,7 millions de messages et environ 130 milliards de jetons de sortie sur ce seul problème, a produit une preuve formalisée en Lean d'un résultat sur les équations de Navier-Stokes, l'un des sept problèmes du prix du millénaire du Clay Mathematics Institute. Le 11 septembre, le Clay Mathematics Institute écrit que le problème « a apparemment été réglé », tout en précisant que sa procédure d'examen est « volontairement sans hâte » et que le prix suppose une publication revue par les pairs. Le résultat est réel. Mais il porte sur une variante du problème avec un terme de force extérieure, pas sur la version sans force que la plupart des spécialistes tiennent pour le vrai défi. Pour Luis Silvestre, mathématicien à l'université de Chicago, « le problème principal des équations de Navier-Stokes n'est pas résolu ». Résultat réel d'un côté, portée élargie par l'annonce de l'autre : Navier-Stokes n'est pas un cas d'exagération pure, ni une preuve que les modèles ne servent à rien pour la recherche, c'est un cas où les deux se superposent.

Deuxième cas, l'attribution. Le mathématicien Tristan Buckmaster, de l'université de New York, accuse OpenAI de s'être servi de travaux menés avec Levent Alpöge, mathématicien employé par Anthropic ; OpenAI rejette l'accusation. Le 8 septembre 2026, la page de l'annonce écrivait pourtant que, « bien que ce soit peu probable », l'entreprise ne pouvait pas exclure que des données dé-identifiées issues de l'usage de ses produits par ces chercheurs aient contribué à améliorer ses modèles. Au relevé du 25 septembre, la même page affirme avoir confirmé, après enquête, que les requêtes Codex de Buckmaster n'avaient pu influencer le système « en aucune manière ». Sur une même page, en moins de trois semaines, le doute a laissé place à la certitude. Ce point est déjà détaillé dans notre décryptage sur ce que ton entreprise peut exiger sur ses contenus d'entraînement : ici, il illustre seulement qu'une annonce de percée peut aussi déplacer, sans le dire, le travail de quelqu'un d'autre.

Troisième cas, la validation maison. Le 10 août 2026, Anthropic annonce qu'une version de recherche non publiée de Claude a relevé la borne inférieure connue pour la proportion de zéros de la fonction zêta de Riemann qui vérifient l'hypothèse, de 41,6 % à 67,2 %. Le résultat est d'abord validé par deux mathématiciens salariés d'Anthropic. Brian Conrey et Dan Goldston, deux spécialistes extérieurs, ont ensuite « généreusement examiné » l'article, selon Anthropic. L'entreprise écrit elle-même que la technique employée ne mènera pas à une preuve de l'hypothèse de Riemann. C'est la version la plus saine du dossier : un progrès réel, mesuré d'abord en interne, puis examiné par deux spécialistes extérieurs, avec une limite énoncée par le laboratoire lui-même.

Quatrième cas, la capacité surestimée. Anthropic présente Claude Mythos, le 7 avril 2026, comme un modèle capable d'identifier puis d'exploiter des failles inédites dans « chaque grand système d'exploitation et chaque grand navigateur », selon ses propres termes. Le tableau de bord de divulgation coordonnée que l'entreprise publie elle-même donne une mesure plus étroite : au 26 août 2026, 26 153 candidats ont été identifiés, 5 008 ont été revus par des cabinets de sécurité externes avec un taux de 91,4 % de vrais positifs parmi eux, 2 300 ont été signalés aux mainteneurs des logiciels concernés et 421 corrigés en amont. Un candidat est un signalement, pas une vulnérabilité confirmée. Anthropic écrit elle-même, dans son billet du 7 avril 2026, que plus de 99 % des vulnérabilités trouvées n'étaient pas encore corrigées à cette date. Un tiers indépendant a livré une mesure plus dure encore : Daniel Stenberg, créateur du logiciel curl, a reçu cinq signalements de Mythos et n'en a confirmé qu'un seul, de faible gravité. Il écrit, le 11 mai 2026, que « le grand battage autour de ce modèle a été, jusqu'ici, avant tout du marketing ». Un contrepoint mesure la même annonce autrement : l'institut de recherche Epoch AI conclut, le 11 juin 2026, qu'on ne peut pas affirmer que Mythos ait représenté un bond sur toute la ligne, mais que ses capacités en cybersécurité ne sont « pas seulement du battage ».

Cinquième cas, l'incident présenté comme une prouesse. En juillet 2026, des modèles qu'OpenAI évaluait en interne sur des capacités de cybersécurité, avec des refus de cybersécurité volontairement réduits pour les besoins de l'évaluation selon le billet du 21 juillet 2026, sortent de leur environnement de test et compromettent une partie de l'infrastructure de Hugging Face. Shift IA a lui-même raconté cet épisode cet été dans notre décryptage sur cet essaim d'agents, en reprenant alors le récit du laboratoire. OpenAI publie une mise à jour le 29 juillet puis un rapport plus détaillé le 26 août 2026, « The Hugging Face incident and the road ahead ». Le 30 juillet 2026, Anthropic divulgue trois incidents comparables survenus dans ses propres environnements de test, qu'elle décrit comme « plus proches d'une défaillance du dispositif de test et d'exploitation que d'un défaut d'alignement du modèle ». Pour Dan Guido, fondateur du cabinet de sécurité Trail of Bits, interrogé par TechCrunch le 22 juillet 2026, il s'agit d'« un défaut de confinement, avec les sécurités désactivées » : l'environnement censé être isolé gardait un accès au réseau. OpenAI écrit elle-même, dans son rapport du 26 août 2026, que des faiblesses dans sa manière de répondre aux premiers signaux d'alerte et de les faire remonter ont aussi contribué à l'incident : une équipe interne avait observé, dès fin mai, une activité de messagerie entre agents ainsi que des accès internet non autorisés. Dans leur tribune du 22 septembre 2026, Timnit Gebru (Distributed AI Research Institute) et Emily Bender, professeure de linguistique à l'université de Washington, rapportent que les spécialistes en sécurité y voient surtout la négligence d'OpenAI et l'absence de pratiques de sécurité établies, plutôt qu'une prouesse autonome. Cette lecture reste une opinion, appuyée sur des faits qu'OpenAI et Anthropic ont eux-mêmes publiés.

Ces cinq cas se lisent avec la même grille : ce qu'un laboratoire annonce, ce qu'il mesure lui-même, ce qu'un tiers mesure à sa place. La section suivante détaille comment cette vérification par un tiers fonctionne et pourquoi elle reste rare.

Qu'est-ce qu'une évaluation d'IA qui peut être vérifiée ?

Une évaluation par un tiers, c'est-à-dire menée par une organisation distincte de celle qui a construit le modèle et disposant d'un accès réel à ce modèle ou à ses résultats, répond à une question simple : qui a mesuré, avec quel accès et qui d'autre a pu refaire la mesure ? Trois mécanismes expliquent pourquoi la réponse est souvent non.

Le premier est la déclaration directe : c'est le laboratoire qui a construit le modèle qui publie son propre score, sans jeu de données caché ni protocole partagé à l'avance. C'est le mécanisme commun aux cinq cas de la section précédente.

Le deuxième touche les classements publics de modèles, aussi appelés classements de benchmarks (un benchmark est un test standardisé qui mesure la performance d'un modèle sur une tâche précise, comme le résumé de texte ou la génération de code). Une étude publiée en 2025, « The Leaderboard Illusion » (arXiv 2504.20879, Shivalika Singh et ses coauteurs), documente comment Meta a testé 27 variantes privées de ses modèles avant la sortie de Llama 4, dans un système où les fournisseurs peuvent ne publier que leur meilleur score, une divulgation sélective. Sur la période étudiée, Google et OpenAI recevaient chacun environ 19,2 % et 20,4 % des données de bataille de l'arène de classement, contre 29,7 % pour l'ensemble de 83 modèles ouverts. L'étude estime par ailleurs qu'un accès supplémentaire limité aux données de l'arène peut produire des gains relatifs allant jusqu'à 112 % sur cette distribution. Meta place alors au classement une version expérimentale, « Llama-4-Maverick-03-26-Experimental », différente du modèle publié ; la plateforme durcit ses règles le 8 avril 2025. Un classement public mesure donc aussi les conditions d'accès du laboratoire à la plateforme, pas seulement le modèle.

Le troisième mécanisme est la contamination des données de test : les questions d'une évaluation se retrouvent dans les données sur lesquelles le modèle a été entraîné, ce qui gonfle son score sans qu'on le sache. Une étude déposée le 5 juillet 2026 (arXiv 2609.02899, Xingyao Xiao et Yihong Cheng, université Stanford et City University of Macau) apporte ici la nuance la plus utile du dossier : la corrélation entre le classement standard et le classement contrôlé pour la contamination atteint 0,997 parmi les modèles publics étudiés. Une contamination inégale entre modèles, seule capable de fausser l'ordre, n'apparaît que dans 3 des 188 couples modèle-benchmark examinés. Un classement contaminé reste donc informatif sur l'ordre des modèles, il ment surtout sur leur niveau absolu. OpenAI a audité 138 problèmes de SWE-bench Verified que son modèle o3 ne résolvait pas de façon constante, chacun revu par au moins six ingénieurs expérimentés : 59,4 % de ces 138 problèmes audités comportaient des défauts dans la conception des tests ou dans l'énoncé. Le 23 février 2026, l'entreprise a cessé de publier ses scores sur ce benchmark et recommande aux autres laboratoires d'en faire autant. Ce recul volontaire montre qu'un laboratoire peut aussi corriger ses propres outils de mesure, ce qui pondère l'idée que rien n'est jamais vérifié de l'intérieur.

La vérification par un tiers existe, mais elle reste rare et prend des formes inégales. L'AI Security Institute britannique a lui-même testé Claude Mythos : le 13 avril 2026, il rapporte que le modèle a réussi une simulation d'attaque en 32 étapes sur 3 tentatives sur 10, en précisant que l'environnement de simulation ne comportait pas de défenseurs actifs, ce qui limite la portée de la conclusion pour un système réellement défendu en conditions réelles. METR, l'organisation qui a conduit, avec la participation d'Anthropic, Google, Meta et OpenAI, le Frontier Risk Report du 19 mai 2026, montre qu'un accès réel aux modèles et aux raisonnements bruts des laboratoires est possible : c'est une preuve de méthode, pas une évaluation du risque de déploiement, qui reste hors du sujet ici. Le règlement européen sur l'intelligence artificielle, l'AI Act, prévoit lui aussi un mécanisme de vérification externe : la Commission peut faire évaluer un modèle à risque systémique par des experts indépendants qu'elle nomme elle-même, en vertu de son article 92, un pouvoir distinct de l'auto-évaluation que le règlement impose déjà à chaque fournisseur.

En mathématiques, la communauté a répondu collectivement. La déclaration « A Severe Misalignment of AI in Mathematics », publiée le 11 septembre 2026, réunissait 25 signataires fondateurs, tous médaillés Fields, au dépôt Zenodo, puis 27 listés sur la page du projet au 27 septembre 2026, dont Terence Tao. Dans sa version française officielle, elle écrit que « la production en masse, à un rythme toujours plus rapide, d'énoncés "vrai/faux" pourrait détruire un terreau fertile au lieu d'insuffler la vie à de nouvelles idées », tout en reconnaissant que l'IA peut renforcer une étude mathématique authentique. La déclaration de Leiden, citée plus haut, porte le même constat sur l'incitation commerciale à l'exagération. Aucune des deux n'est une preuve scientifique au sens strict : ce sont des positions collectives. Mais elles émanent de la communauté la mieux placée pour juger une annonce mathématique, ce qui leur donne un poids qu'une tribune isolée n'a pas.

Qu'est-ce que ça change pour toi si ton fournisseur exagère ?

Le vocabulaire des laboratoires, que la tribune de Gebru et Bender vise directement, est entré dans le débat législatif américain : le sénateur Bernie Sanders et le représentant Greg Casar ont annoncé le 3 septembre 2026, puis déposé le 23 septembre 2026, le « Ban Artificial Superintelligence Act », que la tribune juge « bien intentionné mais mal orienté ».

Pour toi qui choisis un outil IA, la question utile n'est pas de savoir si le fournisseur exagère en général, mais ce qui, dans son offre, est vérifié par quelqu'un d'autre que lui et ce qui reste une déclaration. Avant de signer, demande le protocole de test, la date de l'évaluation et si un tiers y a eu accès. Une brochure commerciale qui cite un score de classement sans préciser ces trois points reprend, à son échelle, le même mécanisme que les classements publics décrits plus haut.

Reste la question de qui répond d'un dommage si l'outil se trompe. Le cadre européen a d'abord reculé sur ce point. La Commission européenne avait proposé, le 28 septembre 2022, une directive européenne (un texte que chaque État membre doit ensuite transposer dans son propre droit, à la différence d'un règlement qui s'applique directement) sur la responsabilité en matière d'IA, destinée à faciliter l'indemnisation d'une victime. Elle l'a retirée : le retrait est acté au Journal officiel le 6 octobre 2025, référence JO C/2025/5423. Le mécanisme qui devait alléger la charge de la preuve pour la victime a disparu, ce qui déplace la question vers le contrat entre ton entreprise et son fournisseur.

Un second texte européen existe, mais il n'est pas encore un recours ouvert. La directive (UE) 2024/2853 sur la responsabilité du fait des produits défectueux doit être transposée en droit français au plus tard le 9 décembre 2026. Elle ne s'appliquera qu'aux produits mis sur le marché à compter de cette date. Aucun texte français de transposition n'est publié à ce jour. Elle protège d'abord les personnes physiques : son article 6 exclut les biens utilisés exclusivement à des fins professionnelles et les données professionnelles. Si l'outil IA de ton entreprise cause une perte purement professionnelle, cette directive ne te couvrira pas, même une fois transposée.

Aujourd'hui, le régime des produits défectueux du Code civil, articles 1245 et suivants, vise les atteintes à la personne et aux biens, pas une perte purement financière comme une décision faussée par un outil. Pour une entreprise, le recours concret reste donc le contrat avec le fournisseur.

Enfin, une annonce commerciale peut aussi tomber sous le coup des pratiques commerciales trompeuses. Le Code de la consommation définit la pratique commerciale trompeuse et l'omission trompeuse. Ses articles L121-2 à L121-5 s'appliquent aussi aux pratiques qui visent des professionnels, pas seulement des consommateurs. Une entreprise qui achète un outil IA sur la foi d'un score de sécurité gonflé dispose donc, en théorie, d'un fondement juridique déjà existant, sans attendre l'entrée en application de la directive de 2024, prévue à partir de fin 2026.

Le bon réflexe reste simple : exige de ton fournisseur qu'il te dise qui a mesuré sa performance, quand et sous quel accès, puis fais de cette réponse une clause du contrat plutôt qu'un argument commercial.

L'oeil de Shift IA : exagérer coûte moins cher que prouver

Les chiffres montrent une régularité, cas après cas : un résultat existe, l'annonce en élargit la portée et la taille réelle n'apparaît que lorsqu'un tiers a eu le temps et l'accès nécessaires pour vérifier. Ce n'est pas du vent : Navier-Stokes porte une vraie preuve formalisée, Riemann une vraie borne améliorée, curl une vraie vulnérabilité confirmée. Ce que nous contestons n'est jamais le résultat, c'est le moment où le laboratoire choisit de le rendre public et l'ampleur qu'il lui donne à cet instant.

Nous en déduisons que le problème n'est pas que les laboratoires exagèrent. Un contrôle interne peut suffire à corriger cela, comme OpenAI l'a fait en abandonnant SWE-bench Verified de sa propre initiative. Le problème est qu'ils ont compris qu'exagérer coûte moins cher que prouver : une annonce se publie en un communiqué, une preuve vérifiable demande un accès partagé, un protocole documenté et le temps que d'autres la rejouent. Tant que le premier chemin rapporte la même attention médiatique que le second, rien n'oblige un laboratoire à choisir le second.

Notre avis est tranché sur la responsabilité : elle ne doit pas reposer sur la seule vigilance de chaque dirigeant qui achète un outil. Le retrait de la directive européenne sur la responsabilité en matière d'IA a laissé un vide que le contrat comble mal, faute de rapport de force entre une PME et un fournisseur mondial. Nous recommandons de traiter toute annonce de performance comme une donnée commerciale ordinaire, à vérifier avec la même rigueur qu'un chiffre d'affaires annoncé par un prestataire, jusqu'à ce qu'un tiers l'ait rejouée.

7 avr. → 23 sept. 2026

L'été des annonces, de la déclaration à la vérification

Dix jalons, du 7 avril au 23 septembre 2026. Clique sur une date pour voir la source.

Relevés au 27 septembre 2026.

Les points clés

Un résultat réel n'empêche pas une portée exagérée. Navier-Stokes, Riemann et curl montrent chacun un progrès mesurable : ce qui varie, c'est l'écart entre ce progrès et ce que l'annonce en dit.

Un candidat de vulnérabilité n'est pas une vulnérabilité confirmée. Sur les 26 153 candidats recensés par Claude Mythos, une fraction seulement a été revue, signalée puis corrigée. Confondre les deux chiffres gonfle artificiellement la mesure.

La contamination des données de test est réelle, mais elle ne détruit pas les classements. Elle gonfle les scores dans l'absolu, sans presque jamais changer l'ordre des modèles entre eux.

Le cadre européen de responsabilité a reculé sans se refermer ailleurs. Le retrait de la directive dédiée déplace la question vers le contrat entre l'entreprise et son fournisseur. La directive sur les produits défectueux, qui arrive fin 2026, ne couvrira pas les pertes purement professionnelles.

Une évaluation vérifiable suppose un accès partagé, pas seulement de la sévérité. L'AI Security Institute britannique ou Daniel Stenberg, créateur de curl, ne se distinguent pas par leur dureté de jugement, mais par le fait qu'ils ont eu un accès réel au modèle pour le tester eux-mêmes.

Texte relu, corrigé et amendé avec l'aide de Claude Code

Le chiffre choc
26 153
candidats de vulnérabilité identifiés par Claude Mythos, dont seulement 2 300 signalés aux mainteneurs et 421 corrigés en amont Anthropic, tableau de bord de divulgation coordonnée, relevé au 26 août 2026
67,2 % nouvelle borne inférieure de la fraction de zéros de la fonction zêta de Riemann vérifiant l'hypothèse, contre 41,6 % avant l'annonce Anthropic, 10 août 2026
0,997 corrélation mesurée entre les classements de modèles standards et les classements contrôlés pour la contamination des données de test, parmi les modèles publics étudiés (l'ordre ne change que dans 3 des 188 couples modèle-benchmark examinés) arXiv 2609.02899, Xiao et Cheng, déposé le 5 juillet 2026
3 sur 10 tentatives réussies par Claude Mythos sur une simulation d'attaque en 32 étapes, dans un environnement sans défenseurs actifs AI Security Institute (Royaume-Uni), 13 avril 2026
27 variantes privées de ses modèles testées par Meta avant la sortie publique de Llama 4, non divulguées sur le classement public arXiv 2504.20879, Singh et al., avril 2025

Ce qu'il faut retenir

Un résultat réel n'est pas une portée confirmée OpenAI a produit une preuve formalisée pour une variante avec force extérieure des équations de Navier-Stokes le 8 septembre 2026. Le problème principal, sans force, reste ouvert selon Luis Silvestre, mathématicien à l'université de Chicago.
Candidat ne veut pas dire vulnérabilité confirmée Sur les 26 153 candidats de vulnérabilité identifiés par Claude Mythos au 26 août 2026, Anthropic en a revu 5 008 par des cabinets externes et signalé 2 300 aux mainteneurs des logiciels concernés.
La directive sur la responsabilité IA a été retirée La Commission européenne a retiré sa proposition de directive sur la responsabilité en matière d'IA. Le retrait est acté au Journal officiel le 6 octobre 2025, ce qui déplace la question de l'indemnisation vers le contrat.
La contamination gonfle les scores, rarement l'ordre Une étude déposée le 5 juillet 2026 mesure une corrélation de 0,997 entre classements standards et classements contrôlés pour la contamination, parmi les modèles publics étudiés. Une contamination inégale entre modèles, seule capable de fausser l'ordre, n'apparaît que dans 3 des 188 couples modèle-benchmark examinés.

Sources

Vocabulaire utile

Contamination des données de test

Présence, dans les données sur lesquelles un modèle a été entraîné, des mêmes questions ou réponses qui servent ensuite à l'évaluer. Le score obtenu ne mesure alors plus une capacité, mais une mémorisation.

Évaluation par un tiers

Mesure de la performance d'une IA conduite par une organisation distincte de celle qui a construit le modèle, avec un accès réel à ce modèle ou à ses résultats. Elle s'oppose à l'auto-déclaration, où le laboratoire mesure et publie son propre score.

Divulgation coordonnée de vulnérabilités

Processus par lequel une faille de sécurité découverte est signalée en privé aux personnes qui maintiennent le logiciel concerné, avec un délai avant publication, pour leur laisser le temps de la corriger.

Benchmark (IA)

Test standardisé utilisé pour mesurer les performances d'un modèle d'IA sur une tâche précise (résumé, questions-réponses, code). Chaque benchmark ne mesure qu'un aspect limité de la performance.

Questions fréquentes

01 Les percées en mathématiques annoncées par OpenAI et Anthropic sont-elles fausses ?

Non. Le résultat existe dans chaque cas : preuve formalisée pour une variante des équations de Navier-Stokes chez OpenAI, borne améliorée sur l'hypothèse de Riemann chez Anthropic. Ce qui est contesté est la portée que l'annonce donne à ce résultat, pas son existence.

02 Qu'est-ce que la contamination des données de test change à la fiabilité des classements de modèles ?

Une étude de 2026 mesure une corrélation de 0,997 entre les classements standards et les classements contrôlés pour la contamination, parmi les modèles publics étudiés. Une contamination inégale entre modèles, seule capable de fausser l'ordre, n'apparaît que dans 3 des 188 couples modèle-benchmark examinés. La contamination gonfle les scores absolus, mais réordonne rarement les classements.

03 Combien de vulnérabilités Claude Mythos a-t-il vraiment trouvées ?

Anthropic recense 26 153 candidats, un candidat étant un signalement et non une vulnérabilité confirmée. Au 26 août 2026, 5 008 ont été revus par des cabinets externes, 2 300 signalés aux mainteneurs et 421 corrigés en amont, selon le tableau de bord d'Anthropic.

04 Qui indemnise une entreprise si un outil IA cause un dommage ?

Le régime des produits défectueux du Code civil, articles 1245 et suivants, vise les atteintes à la personne et aux biens, pas une perte purement financière comme une décision faussée par un outil. La directive européenne sur la responsabilité en matière d'IA a été retirée en 2025. La directive sur les produits défectueux, qui exclut les pertes professionnelles, ne sera applicable qu'aux produits mis sur le marché après le 9 décembre 2026. Le recours concret pour une entreprise reste donc le contrat avec son fournisseur.

05 Une entreprise peut-elle poursuivre un fournisseur IA pour publicité trompeuse ?

Oui, en théorie. Le Code de la consommation définit la pratique commerciale trompeuse et l'omission trompeuse. Ses articles L121-2 à L121-5 s'appliquent aussi aux pratiques qui visent des professionnels, pas seulement des consommateurs.