0923 | Chaque token compte

||Download

Show notes

Au menu : la vague de nouveaux modèles IA et leurs prix en chute, la machine à déisions typées Jev, une rafale d'actualités sécurité (SAML, WordPress, FBI prétendument piraté, VPN et OS mobiles), les fuites de l'IA dans le monde réel, les nouveaux runtimes et sandbox, et l'écosystème Apple contaminé par la pub.

Chronologie

  • 00:00:04 Introduction
  • 00:00:23 Guerre des modèles : Opus 5.5 contre GPT-6
  • 00:03:16 Jev et le pari des décisions typées
  • 00:05:12 Sécurité : FBI visé, WordPress sérieusement troué
  • 00:07:42 SAML, cette fractale de mauvais design
  • 00:09:23 L'IA hors du labo : frappe au Pentagone et Enigma craqué
  • 00:11:59 Compilateurs et runtimes : du rétro au natif
  • 00:14:06 Apple : pub forcée et IA indésactivable
  • 00:15:43 Wcup et pub : l'écran est un risque ; et l'open source frappe
  • 00:17:44 Conclusion

Liens connexes

Cet épisode est produit par Bri. Bri utilise une technologie d'IA avancée pour transformer les flux qui vous intéressent en podcasts conçus pour l'écoute. Contactez-nous à hi@bri.so.

Transcript

Claire Martin: Bonjour et bienvenue dans l'émission de cette semaine, moi c'est Claire Martin.

Nicolas Moreau: Et moi Nicolas Moreau. Et si on devait trouver un fil rouge à tout ce qui s'est passé ces dernières vingt-quatre heures, c'est un peu l'accélération générale : les modèles d'IA qui se répondent à quelques jours d'écart, des failles de sécurité massives, des choix d'Apple qui font grincer des dents, et même des projets qui ressuscitent des technologies qu'on croyait enterrées.

Claire Martin: Et on va commencer exactement par là, par cette course entre Anthropic et OpenAI, parce que c'est elle qui éclaire une bonne partie du reste de l'épisode. Anthropic a sorti Claude Opus 5.5, et OpenAI a riposté presque immédiatement avec GPT-6, décliné en deux versions, Sol et Luna.

Nicolas Moreau: Alors reprenons les chiffres, parce qu'ils racontent une histoire. Opus 5.5 est présenté comme le nouveau leader en codage agentique, avec un index AA de 58, un contexte d'un million de tokens, et un tarif de 4 dollars l'entrée et 20 dollars la sortie par million de tokens.

Claire Martin: Et le point le plus intéressant, c'est que ça représente environ la moitié du coût par tâche par rapport à Opus 5. Donc Anthropic ne fait pas que monter en performance, ils cassent aussi leur propre grille de prix.

Nicolas Moreau: Et côté alignement, ils annoncent de meilleurs scores. C'est un argument de plus pour les entreprises qui mettent des agents en production, parce que l'alignement, concrètement, ça se traduit par moins de comportements imprévus quand l'agent enchaîne des dizaines d'appels d'outils tout seul.

Claire Martin: OpenAI, de son côté, lance GPT-6 Sol et Luna avec une API 50 pour cent moins chère que la 5.6. Sol coûte 2 dollars en entrée et 10 dollars en sortie par million de tokens, et Luna est donnée à 0,10 dollar et 0,50 dollar.

Nicolas Moreau: Luna à dix centimes, c'est quasiment du jetable comme prix. C'est clairement une arme de guerre tarifaire.

Claire Martin: Et ce qui est frappant, c'est la dynamique. On a deux générations qui se répondent à quelques jours d'écart, avec des baisses de prix des deux côtés. Ce n'est plus un rythme annuel, c'est une course où chacun sort une brique dès que l'autre bouge.

Nicolas Moreau: Et la vraie question que je me pose, c'est l'effet réel sur les coûts des agents en production. Parce qu'un agent, ce n'est pas un appel, c'est des dizaines, des centaines d'appels. Il existe d'ailleurs un projet qui mesure exactement ça : Unreal Agent, un harness à appels d'outils asynchrones, qui annonce jusqu'à 40 pour cent d'économies par rapport à Codex, avec une qualité inchangée.

Claire Martin: Ça confirme quelque chose d'important : à modèle égal ou proche, une grosse partie des gains se joue dans l'orchestration, pas seulement dans le prix du token. Entre un harness asynchrone qui économise 40 pour cent et des modèles 40 à 50 pour cent moins chers, on peut se retrouver avec des coûts d'agent divisés par deux ou par trois sans sacrifier la qualité.

Nicolas Moreau: Et là-dessus, les commentaires divergent pas mal. Certains disent que la guerre des prix est bonne pour tout le monde, que les clients de production sont les grands gagnants. D'autres répondent que les prix baissent parce que la marge du haut de gamme est attaquée, et qu'à terme, ce qui compte ce n'est plus le prix par token mais le prix par tâche accomplie.

Claire Martin: C'est d'ailleurs exactement le chiffre qu'Anthropic met en avant, le coût par tâche, pas le coût par token. Ça veut dire qu'eux-mêmes ont compris que la métrique du client, c'est la tâche finale.

Nicolas Moreau: Et il y a un débat qui reste ouvert : la qualité de codage agentique, ça se mesure vraiment de façon fiable ? Un index AA de 58, c'est impressionnant sur le papier, mais chacun a sa batterie de tests, et on ne compare pas toujours les mêmes choses.

Claire Martin: C'est une vraie question sans réponse pour l'instant. Et cette concurrence féroce, elle explique aussi un autre sujet de l'actualité : pourquoi OpenAI serait tenté de copier un produit comme Jev. Parce que quand la guerre fait rage, copier vite ce qui marche ailleurs devient une stratégie.

Nicolas Moreau: Alors parlons de Jev justement. C'est le produit de TypeSafe, et c'est une approche radicalement différente des gros modèles généralistes.

Claire Martin: Le concept, c'est un modèle à décisions typées. Au lieu de générer du texte libre, le modèle sort des décisions structurées : des choix, des booléens, des scores, chacun accompagné de probabilités calibrées. Et c'est facturé par requête, via une clef API.

Nicolas Moreau: Ce qui change tout, c'est le mot calibrées. Dans un LLM classique, quand il dit qu'il est sûr à 80 pour cent, rien ne garantit que ce soit vrai dans 80 pour cent des cas. Avec des probabilités calibrées, si, et ça, pour un système qui prend des décisions automatiques, c'est énorme.

Claire Martin: Et le typage apporte quelque chose de très concret : une décision booléenne ou un choix dans une liste fermée, c'est vérifiable, c'est testable, ça s'intègre dans du code existant sans parser du texte naturel en espérant qu'il soit bien formaté.

Nicolas Moreau: Les commentateurs y voient deux lectures opposées. Les uns disent que c'est l'avenir : pour la majorité des usages en production, on n'a pas besoin d'un poète, on a besoin d'un composant fiable qui rend des décisions. Les autres répondent que la flexibilité du langage naturel reste irremplaçable pour les cas imprévus, et qu'un modèle à décisions typées sera toujours limité aux tâches qu'on a pensées à l'avance.

Claire Martin: Et il y a l'angle stratégique, avec Arcturus Labs qui estime qu'OpenAI est bien placé pour recopier le concept et l'intégrer dans ses propres modèles.

Nicolas Moreau: Ce qui est logique dans le contexte dont on parlait : avec Sol et Luna, OpenAI a une gamme qui va du modèle de travail au modèle quasi gratuit, et intégrer la sortie typée par-dessus, c'est un pas technique pas insurmontable.

Claire Martin: Du coup, quelle est la défense de TypeSafe ? Arcturus Labs donne la réponse : le vrai moat de TypeSafe, ce serait ses données d'entraînement.

Nicolas Moreau: Et c'est un moat fragile, non ? Les données se récoltent, se simulent, s'achèvent. La vraie question à surveiller, c'est combien de temps cet avantage survit. Six mois ? Deux ans ?

Claire Martin: Personne ne le sait, et c'est ce qui rend ce sujet intéressant : c'est un pari technologique ET un pari d'entreprise. Mais rester sur l'API et l'intégration, ça amène naturellement aux mauvaises pratiques du secteur, et là on passe à deux histoires de sécurité qui font mal.

Nicolas Moreau: La première fait déjà beaucoup de bruit : ShinyHunters affirme avoir piraté le FBI. Pas une petite branche, le FBI lui-même, via un zero-day dans PeopleSoft.

Claire Martin: Avec à la clé, selon leurs déclarations, les données de tous les employés, environ 2 à 3 téraoctets, et un site d'offres d'emploi du FBI défacé.

Nicolas Moreau: Et il faut dire très clairement aux auditeurs : ce sont des affirmations du groupe, pas des faits établis. Le chiffre des téraoctets, l'étendue des données, tout ça doit être pris avec beaucoup de prudence tant qu'il n'y a pas de confirmation côté FBI.

Claire Martin: Ce qui est vérifiable et documenté, c'est le vecteur : PeopleSoft. Et ça, c'est un rappel brutal. Les applications d'entreprise legacy, ces monstres des années 2000 qui tournent dans les administrations et les grandes boîtes, sont une surface d'attaque principale, exactement au même titre que le web de tous les jours.

Nicolas Moreau: Et si on doutait que le web de tous les jours soit aussi exposé, WordPress vient de le prouver une fois de plus. Une traversée de chemin non authentifiée dans la fonction get_page_template, qui peut mener à une exécution de code conditionnelle. Un score CVSS de 9.2.

Claire Martin: 9.2, c'est critique. Et le détail qui montre la gravité aux yeux de l'équipe sécurité de WordPress : les correctifs ont été poussés jusque dans la branche 4.7.

Nicolas Moreau: Il faut contextualiser pour les non-spécialistes : WordPress 4.7 date de fin 2016. Corriger une faille dans une branche qui a neuf ans, ça veut dire qu'ils savent qu'une fraction énorme du web tourne encore sur des versions antérieures et ne fera jamais la mise à jour majeure. Plutôt que de les laisser exposés, ils patchent en arrière.

Claire Martin: Et le facteur non authentifié est central ici. Une faille exploitable par n'importe qui, sans compte, sans identifiants, sur le CMS qui fait tourner une part gigantesque du web, c'est la définition du cauchemar.

Nicolas Moreau: La suite, on la connaît : les admin vont patcher en urgence, une partie ne le fera pas, et les scanneurs automatiques vont exploiter la fenêtre. C'est le cycle classique, et il se répète inlassablement.

Claire Martin: Et il y a un troisième nom qui est venu alimenter la discussion sécurité : Muse, de Meta. Un utilisateur a demandé une archive du filesystem, elle a été envoyée sur Google Drive, et une fois décompressés, 6,8 gigaoctets contenaient des clés SSH. Quand il a signalé ça en bug bounty, la réponse a été « Not Applicable », non applicable.

Nicolas Moreau: C'est le genre de réponse qui rend les gens furieux, et à juste titre. Des clés SSH dans une archive envoyée sur un service tiers, avec un classement « non applicable » au bug bounty, ça envoie le message que ce genre de fuite ne compte pas.

Claire Martin: Bon, restons prudents sur le détail du scénario exact, mais le principe posé par ce signalement est limpide : quand une plateforme ne récompense pas ce type de découverte, elle pousse les chercheurs à la publication directe plutôt qu'à la divulgation responsable.

Nicolas Moreau: Et ça rejoint exactement le sujet suivant, parce qu'on va parler d'un protocole que Trail of Bits, une boîte de sécurité très respectée, a écharpé publiquement. Ils qualifient SAML de fractale de mauvais design.

Claire Martin: J'adore cette formule, et elle est précise. Une fractale, c'est quelque chose qui présente la même complexité à toutes les échelles. Et c'est exactement SAML : à chaque niveau où tu regardes, tu trouves un piège.

Nicolas Moreau: Le premier niveau, c'est XML. Un format verbeux, avec des subtilités de parsing qui varient d'une implémentation à l'autre. Deux parseurs peuvent voir deux documents différents dans le même fichier, et en sécurité, cette ambiguïté est une arme.

Claire Martin: Et le deuxième niveau, ce sont les signatures enveloppées. C'est le cœur technique du problème : la signature est À L'INTÉRIEUR du document qu'elle signe. Pour vérifier, il faut extraire une partie, la vérifier, et croire que ce qu'on a vérifié est bien ce qu'on a validé. L'histoire des attaques SAML est en grande partie une histoire de failles dans cette gymnastique.

Nicolas Moreau: La conclusion de Trail of Bits est sans appel : migrer vers OIDC. Et les commentateurs rejoignent massivement ce constat, avec un bémol récurrent : dans les grandes entreprises, SAML est coulé dans le béton. Des centaines d'applications internes, des intégrations vieilles de dix ans, des fournisseurs qui ne supportent qu'eux.

Claire Martin: Ce qui veut dire que le mouvement vers OIDC va se poursuivre côté fournisseurs, mais la migration réelle des entreprises prendra des années. Et le lien avec notre épisode est direct : on vient de parler d'un zero-day dans PeopleSoft, une appli d'entreprise legacy. SAML, c'est exactement la même génération de technologie, le même ADN, la même exposition.

Nicolas Moreau: Et le SSO, quand tu y réfléchis, c'est l'endroit où la sécurité des utilisateurs devient très concrète, parce que c'est la porte d'entrée de tout. Et c'est un bon pont vers les outils quotidiens et la confiance qu'on leur accorde.

Claire Martin: Restons dans l'IA, mais changeons radicalement de registre. Deux histoires qui se répondent, et le contraste est saisissant. D'abord, un précédent très lourd : le Pentagone attribue une frappe de missile sur une école iranienne à une surconfiance dans l'IA.

Nicolas Moreau: On mesure ce que ça signifie. Une frappe de missile, des victimes civiles, et l'explication officielle, c'est la surconfiance dans un système d'IA. Ça pose la question de l'humain dans la boucle des décisions armées de la façon la plus brutale possible.

Claire Martin: Et il faut être honnête sur ce qu'on ignore encore : les détails du processus de décision ne sont pas publics. On ne sait pas précisément quel système était impliqué, qui a validé quoi, à quel moment la chaîne de confiance a dérapé.

Nicolas Moreau: Et ça, c'est le débat central dans les commentaires. Certains disent que la leçon, c'est qu'il faut retirer l'IA des boucles létales, complètement. D'autres répondent que le problème n'est pas l'outil mais l'organisation, et que la surconfiance, ça se combat par des procédures et de la formation, pas en interdisant la technologie.

Claire Martin: Les deux positions ont un point commun : personne ne défend l'idée qu'on peut laisser une machine décider seule d'une frappe. Le désaccord porte sur le remède.

Nicolas Moreau: Et maintenant le contraste, le même mois, à l'autre extrême de la fiabilité : GPT-6 Astra a cassé seul le message Enigma MVUEH de 1941, introuvable depuis 2005.

Claire Martin: Les détails sont remarquables. Il a utilisé le crib ROSENOW, cette technique de texte probable qui a fait le succès des mathématiciens de Bletchley Park, et il a écrit lui-même les outils dont il avait besoin pour la recherche. Personne ne lui a fourni un craqueur d'Enigma tout fait.

Nicolas Moreau: Donc d'un côté, une IA à qui on confie des décisions critiques et qui, entourée d'humains, contribue à une catastrophe. De l'autre, une IA à qui on confie un puzzle cryptographique, seule, et qui réussit là où vingt ans de cryptanalyse ont échoué.

Claire Martin: Et ça c'est la preuve d'une capacité réelle, pas d'un gadget. C'est exactement l'opposé des erreurs de fiabilité dont on parlait avec le Pentagone. La même technologie, deux cadres d'usage, deux résultats inverses.

Nicolas Moreau: Et ce cadre d'usage, c'est LA question de la décennie : l'IA pour explorer, chercher, résoudre, ça marche déjà très bien. L'IA pour décider à notre place dans des domaines à conséquences humaines, c'est là que ça casse.

Claire Martin: Et il y a même un clin d'œil méthodologique dans l'actualité : une expérience qui traite gzip, l'outil de compression le plus banal du monde, comme un modèle de langage, avec du beam search, et utilise le taux de compression comme score prédictif, en reproduisant partiellement certaines propriétés du texte.

Nicolas Moreau: C'est un peu ésotérique dit comme ça, mais l'idée de fond est belle : la compression, c'est de la prédiction. Si tu peux compresser un texte, c'est que tu peux prédire ses prochains octets. Cette expérience le vérifie avec un outil des années 90. Et ça, ça rejoint les deux histoires précédentes : la capacité de prédiction existe, le problème c'est le cadre dans lequel on la déploie.

Claire Martin: Et justement, la prédiction et l'exécution, on va les retrouver dans deux projets qui réinventent des piles technologiques anciennes. Premier projet : GeaStack.

Nicolas Moreau: GeaStack, c'est fou : ça compile du TypeScript en C++ natif, sans moteur JavaScript. Tu écris du TypeScript, tu obtiens du binaire natif. Et le rendu se fait en natif via CSS et JSX, y compris sur un ESP32.

Claire Martin: Un ESP32, pour le public qui ne connaît pas, c'est un microcontrôleur à quelques euros qu'on met dans des objets connectés. Faire tourner une interface web moderne là-dessus, c'est normalement impensable. Là, le code est compilé, pas interprété, donc il rentre dans la mémoire du microcontrôleur.

Nicolas Moreau: Les commentateurs voient deux signaux dans ce projet. D'abord, le retour du natif : après des années où tout est passé par des couches interprétées et des machines virtuelles, la compilation directe revient, portée par des outils modernes comme les compilateurs Rust et les frontends TypeScript.

Claire Martin: Et deuxièmement, la longévité du développeur web. Si tu peux réutiliser tes compétences TypeScript, CSS, JSX pour cibler du matériel embarqué, tu touches des milliards d'appareils sans apprendre le C.

Nicolas Moreau: Et le deuxième projet est encore plus rétro : FoxScript, qui relance Visual FoxPro 9. Un environnement de développement d'applications de gestion arrêté en 2007, presque vingt ans.

Claire Martin: Sur un runtime 64-bit en Rust, avec du wasm aussi. Et les deux features qui montrent qu'ils ont compris le vrai besoin des clients : les tables au-delà de la limite des 2 gigaoctets, et le support des .fll 32-bit, les bibliothèques d'extension existantes.

Nicolas Moreau: C'est là-dessus qu'il faut insister. Il y a des milliers d'applications métier en FoxPro qui tournent encore dans des entreprises, des PME, des administrations. Elles fonctionnent, elles connaissent leur métier, mais elles sont coincées sur du 32-bit, des limites de tables, un écosystème mort.

Claire Martin: FoxScript ne remplace pas ces applications, il les fait migrer sans réécriture. C'est le rêve de tout directeur informatique dans ce cas. Et le signal commun avec GeaStack, c'est clair : le logiciel métier a une durée de vie de plusieurs décennies, et une partie de l'industrie recommence à en tenir compte.

Nicolas Moreau: La vraie question à suivre, c'est l'adoption réelle. Un runtime brillant qui n'a pas de clients, ça reste une démo. Les commentaires sont partagés entre l'enthousiasme pour la technique et le scepticisme sur la capacité de ces projets à convaincre des entreprises prudentes.

Claire Martin: Et en gardant ce fil de la confiance qu'on accorde aux outils, on arrive au sujet qui a fait le plus tiquer cette semaine : Apple. Deux décisions, ou plutôt deux impasses, qui vont dans le même sens.

Nicolas Moreau: Première : des pubs persistantes non masquables dans iOS. Le mot « pubs » est d'ailleurs entre guillemets dans les discussions, parce qu'on ne sait pas trop quoi en penser. Et un App Store gonflé d'annonces plein écran, y compris au milieu des résultats de recherche.

Claire Martin: Donc tu cherches une application, et avant d'atteindre le résultat, tu traverses une annonce plein écran. C'est une dégradation directe de l'expérience, sur un appareil que tu as payé très cher.

Nicolas Moreau: Et le contraste avec le positionnement historique d'Apple est cinglant : pendant des années, l'argument vente, c'était « pas de pub, contrairement aux autres ». Les commentateurs sont assez unanimes pour dire que c'est un tournant, même si certains nuancent en rappelant qu'Apple a des revenues services à faire croître.

Claire Martin: Deuxième décision, encore plus radicale : dans macOS 27, le commutateur de désactivation d'Apple Intelligence a été supprimé. Et pire, pour un utilisateur qui avait déjà réglé sur « non », le réglage est ignoré : Apple Intelligence occupe désormais 22,28 gigaoctets sur sa machine, sans qu'il puisse y faire quoi que ce soit.

Nicolas Moreau: 22 gigaoctets, c'est plus que beaucoup d'applications professionnelles entières. Et le fait que le « non » soit ignoré, c'est ça le plus grave. Ce n'est pas juste un réglage absent, c'est un choix explicite de l'utilisateur qui est annulé par une mise à jour.

Claire Martin: La tendance est inquiétante et les commentaires le disent crûment : l'utilisateur perd des leviers. Petit à petit, l'appareil devient un service qu'on subit plutôt qu'un outil qu'on contrôle.

Nicolas Moreau: Ce qu'on surveille maintenant, c'est la réaction des régulateurs et des utilisateurs. En Europe notamment, forcer un service que l'utilisateur a explicitement refusé, ça pose des questions de conformité très concrètes.

Claire Martin: Et cette histoire de pub nous amène exactement au sujet suivant, parce que la pub, elle est aussi sur les écrans du monde entier, y compris les plus regardés : ceux de la Coupe du monde.

Nicolas Moreau: Une étude de l'université de Bristol a recensé plus de 93 000 affichages de marques nuisibles pendant la Coupe du monde. Et le détail qui fait mal : 70 pour cent concernaient des aliments malsains.

Claire Martin: Et ces affichages étaient visibles dans environ un quart des directs. Donc si tu regardes un match en direct, tu as une chance sur quatre de voir une promotion de malbouffe, sans aucun filtre.

Nicolas Moreau: Ce que cette étude apporte, c'est la document­ation chiffrée : la publicité comme risque sanitaire, mesuré, pas juste supposé. Ça change la nature du débat, on ne discute plus d'une impression, on discute d'un compte.

Claire Martin: Le parallèle avec Apple est frappant : dans les deux cas, l'écran devient un vecteur de marketing que l'utilisateur n'a pas choisi. Sauf qu'ici, ce sont des événements sportifs et des chaînes, avec un public qui comprend mieux le pacte publicitaire. Mais pour les enfants qui regardent, la nuance s'efface.

Nicolas Moreau: Et pour finir sur une note différente, l'open source qui frappe un grand coup : MiMo-V2.6-Pro. Un modèle avec un index AA de 46, 125 tokens par seconde, licence MIT, un trillion de paramètres dont 42 milliards actifs.

Claire Martin: Une licence MIT sur un modèle de cette taille, c'est un vrai événement. N'importe qui peut le télécharger, l'héberger, le modifier, le vendre même. Et le principe des 42 milliards de paramètres actifs sur un trillion, c'est une architecture sparse : à chaque étape, seule une fraction du réseau travaille, ce qui explique la vitesse de 125 tokens par seconde et un coût d'inférence raisonnable.

Nicolas Moreau: Et avec un index AA de 46, il se situe bien en dessous des leaders dont on parlait en début d'épisode, Opus 5.5 à 58. Mais le calcul économique est différent : un modèle à 46, en auto-hébergé, avec une licence MIT qui ne te limite en rien, ça suffit pour énormément de cas d'usage en production.

Claire Martin: Et ça boucle joliment l'épisode : en haut, une guerre entre deux géants propriétaires qui baissent leurs prix chaque semaine ; en bas, une option ouverte qui progresse vite et qui pèse déjà. Entre les deux, les utilisateurs et les entreprises ont peut-être, pour la première fois, un vrai choix.

Nicolas Moreau: C'est exactement ça, et c'est ce qui rend cette période passionnante à suivre. Merci de nous avoir écoutés, on se retrouve très bientôt pour la suite.

Claire Martin: Salut à tous, et à la prochaine !