Veille IA
Le digest plus bas n'est pas une maquette : c'est la dernière publication du système, qui tourne chaque lundi à 7h30 sans personne derrière.
Actu IA
lundi 5 octobre 2026
Trois laboratoires ont aligné des modèles à 2 $/10 $ en 72 heures, avec des disponibilités très différentes. Google a annoncé son flagship Gemini 4 Argon en accès restreint, Anthropic a livré Sonnet 5.5 à tout le monde, et OpenAI a lancé Dots, des agents toujours actifs avec leur propre ordinateur cloud.
-
À la une
Écosystème ClaudeClaude Sonnet 5.5, le milieu de gamme qui rattrape Opus sur le terminal
Anthropic a lancé le 28 septembre Claude Sonnet 5.5, deuxième modèle de la famille 5.5, au même tarif que Sonnet 5: 2 $ le million de tokens d’entrée, 10 $ en sortie, 0,20 $ en lecture de cache. Le laboratoire le positionne comme complément plus rapide d’Opus 5.5 pour les tâches bien cadrées, le correctif de bugs, et les documents, slides et tableurs, avec un œil marqué pour le design. Sur Terminal-Bench 4.0, Anthropic affiche 70,6 % contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5; le modèle gagne aussi plus de 30 % en vitesse de génération et, selon le labo, jusqu’à 30 % de coût en moins par tâche grâce à moins de tokens. Artificial Analysis le place n°2 de son Intelligence Index (56, deux points derrière Opus 5.5 max) mais mesure à l’effort max environ 193k tokens de sortie par tâche, le plus lourd relevé, soit un coût d’environ 7,60 $ par tâche, 50 % au-dessus de Sonnet 5. Chez Anthropic, Cat Wu indique qu’en Claude Code les utilisateurs terminent environ 30 % de tâches en plus; Simon Willison le trouve presque au niveau d’Opus 5.5 sur plusieurs exercices de code, et c’est désormais le modèle du palier gratuit de claude.ai. C’est le premier Sonnet à partir avec les garde-fous cyber des modèles les plus capables, les requêtes à haut risque basculant visiblement vers Sonnet 5.
Anthropic, Introducing Claude Sonnet 5.5 Cat Wu (Claude Code) sur X
- IA générative
Gemini 4 Argon, le flagship Google d’abord réservé aux cyberdéfenseurs
Google DeepMind a annoncé le 30 septembre Gemini 4 Argon, son nouveau modèle frontier, conçu pour des workflows longs en génie logiciel, en travail de connaissance (juridique, finance) et en cyberdéfense. La limite de sortie passe de 64k à 1 million de tokens. Google revendique un état de l’art sur DeepSWE v1.1 (77,9 %), la première place de l’indice Vals (pondéré par le PIB américain) et 51,3 % sur AutomationBench. Le tarif d’introduction est de 2 $ / 10 $ par million de tokens (entrée / sortie), cache à −95 %, avant un palier prévu à 4 $ / 20 $. L’accès public n’est pas ouvert: le modèle part d’abord vers des cyberdéfenseurs de confiance via le programme Fairwind, pendant que Google participe au processus volontaire américain d’accès pré-sortie. En interne, Google décrit des agents Argon qui ont libéré plus de 300 TiB de mémoire dans ses datacenters et qui migrent des bases C/C++ vers Rust, jusqu’à 800k lignes pour le noyau Zircon de Fuchsia. Aucun retour d’usage indépendant n’est encore disponible hors partenaires, l’accès grand public et API payante n’ayant pas commencé.
Google, Introducing Gemini 4 Argon The New York Times, Google Releases a New Flagship A.I. Model, With Limits
- IA générative
Dots, des agents OpenAI toujours actifs avec leur propre ordinateur
Au DevDay du 29 septembre, OpenAI a lancé Dots: des agents alimentés par GPT-6 Astra, chacun avec un ordinateur cloud et un navigateur, capables de travailler 24 h/24 vers un objectif. Ils se branchent sur plus de 4 000 applications via les plugins, et on les joint depuis ChatGPT, Slack, Teams ou un appel vocal. L’utilisateur peut ouvrir l’ordinateur du Dot à tout moment, et lui donner éventuellement accès à son propre laptop. Le premier Dot est inclus dans les formules Pro et Business Premium (hors EEE, Suisse et Royaume-Uni pour Pro au lancement); Enterprise, Edu et Santé y accèdent en bêta si l’admin l’active. OpenAI a aussi montré des Dots spécialistes d’entreprise, avec identité propre et gouvernance prévue via Microsoft Agent 365. Nick Vasilescu, qui les a utilisés, estime que beaucoup s’en servent comme d’un assistant personnel alors qu’ils orchestrent surtout des sessions Codex en parallèle: on peut empiler les messages, le Dot lance et gère plusieurs jobs. GPT-6.1 Sol, l’autre sortie du DevDay, approche Astra sur le code agentique à 2 $ / 10 $, soit un cinquième du tarif Astra, dans l’API et dans ChatGPT Work et Codex, pas encore dans le Chat.
-
Tips et sorties mineures
Écosystème ClaudeClaude Mods: les plugins peuvent désormais modifier le comportement de Claude Code
La version 2.1.287 (1er octobre) introduit les Claude Mods: un plugin JS/TS qui s’exécute dans la session, pas un script externe. Un mod peut dessiner un bandeau ou un panneau, restyler l’interface, intercepter un appel d’outil, ou exécuter une commande slash sans tour de modèle. Addy Osmani montre qu’on peut en faire écrire un par Claude, avec rechargement à chaud: Token Weather affiche le remplissage de la fenêtre de contexte au-dessus du prompt, Blast Radius retient un rm -rf ou un force push et montre ce qu’il toucherait, Replay Theater rejoue les diffs du dernier tour. Un mod tourne avec les mêmes permissions que l’utilisateur (fichiers, réseau, secrets, session); claude plugin validate liste les hooks et les appels avant installation. Le mod intégré You should know, désactivé par défaut, lance un agent de côté qui signale ce que vous ou Claude pourriez rater. Activation: /plugin enable cc-plugin-you-should-know@builtin, sessions first-party avec télémétrie. Dans la démo Anthropic, Claude ajoute des retries sur un timeout de paiement, les tests passent, puis l’agent de côté interrompt: ces retries peuvent débiter un client deux fois.
Docs Anthropic, Mods overview Addy Osmani, Getting started with Claude Code mods
- IA & design
Figma Motion: styles d’animation réutilisables, audio, texte et export Lottie
Le 30 septembre, Figma a étendu Motion (toujours en bêta ouverte) pour le rendre réutilisable comme un design system. On enregistre un style d’animation (easing, durée, propriétés liées à des variables), on combine plusieurs styles en un motif, et on le publie dans les bibliothèques. L’agent Figma et les agents de code via MCP ou Skills peuvent appliquer ces styles automatiquement. La timeline accepte désormais un fichier audio (rognage, découpe, calage sur les keyframes), exportable avec l’animation en MP4 et WebM. Le texte s’anime par caractère, mot ou ligne, tout en restant éditable. L’export sort aussi en Lottie et dotLottie. L’API plugins (update 140) expose createCustomAnimationStyle() et l’application d’un style CUSTOM. Le même jour, Figma ouvre les Community riffs: un format court pour publier animations, prototypes et expériences sur le profil Community.
- Écosystème Claude
Sur X, le coût par tâche finie pèse plus que le tarif au token
Rari (@0xwhrrari) a publié le 3 octobre une comparaison Sonnet 5.5 / Opus 5.5 après une semaine d’usage. Sonnet 5.5 est moins cher par run; Opus 5.5 peut rester moins cher par tâche réellement terminée, une fois l’effort, les ratés de cache et les retries abandonnés pris en compte. Il propose de mesurer ce que le job a vraiment coûté, pas le prix affiché au million de tokens, et de router: Sonnet quand le spec est clair, Opus quand il faut d’abord comprendre le dépôt. Jon (@noisemakerjon) rapporte de son côté que Sonnet 5.5 en effort low lui suffit pour de l’orchestration, au niveau d’Opus 5.5. Ces retours recoupent le positionnement d’Anthropic (Sonnet pour le travail cadré, Opus pour le jugement soutenu) tout en insistant sur une métrique que les barèmes officiels ne donnent pas.
- Écosystème Claude
Un setup Claude Code: Opus planifie, Sonnet exécute, Fable conseille
Cabbit (@cabbitar) décrit un routage d’équipe qu’il fait reconstruire par Claude Code plutôt que de tout coller sur Opus. Opus 5.5 reste en effort high pour le plan et le code qui engage; des sous-agents explorer, worker et researcher tournent en Sonnet 5.5 effort medium (lecture du dépôt, edits et tests, doc); Fable 5.1 n’intervient que via /advisor, avant un gros plan, quand une erreur se répète, et avant de déclarer une longue tâche terminée. Le prompt qu’il colle inspecte ~/.claude/agents, propose effortLevel: high et advisorModel: fable dans settings.json, et n’écrit rien tant qu’on n’a pas dit d’y aller. Il signale aussi les bloqueurs de l’advisor (CLAUDE_CODE_DISABLE_ADVISOR_TOOL, télémétrie coupée). L’idée n’est pas nouvelle en soi, mais le calibrage Sonnet 5.5 / Opus 5.5 / Fable 5.1 date de cette semaine, après l’arrivée de Sonnet 5.5.
Stack
- n8n
- Grok 4.6
- Astro
- Vercel Blob
- Statut
- Production · publie chaque lundi à 7h30
Le problème
Travailler dans l'IA impose de suivre un domaine qui bouge chaque semaine : les modèles, les outils, les usages. L'actu est dispersée entre les médias web et X, où les annonces sortent en premier mais que je ne consulte pas, le tout en anglais. Décrocher quelques semaines, c'est rater un modèle ou un outil qui change ce qui est faisable. Ce système, je l'ai construit d'abord pour moi : c'est mon propre digest, je le lis le lundi matin.
Le système
Chaque lundi à 7h30, un workflow monté dans n8n se déclenche. Il interroge Grok, le modèle de xAI qui cherche en direct sur le web et sur X, avec une consigne : les cinq à sept actus les plus significatives de la semaine écoulée, en tête les deux ou trois sorties majeures, sur mes trois axes (l'actu de l'IA générative, l'écosystème Claude et Claude Code, l'IA dans le design et le web), résumées en français avec assez de contexte pour être comprises sans ouvrir la source. Le résultat part en email dans ma boîte et s'affiche sur cette page. Le workflow tient aussi un journal des sujets déjà traités, pour ne pas radoter d'un digest à l'autre.
Le résultat
Le système tourne seul, pour quelques centimes par digest. Je lui ai aussi fixé deux règles d'honnêteté. Une période sans actu majeure le dit tel quel, plutôt que de gonfler des sujets mineurs. Et une info repérée sur X mais pas encore reprise ailleurs est publiée avec la mention « pas encore confirmé », plutôt que jetée : c'est souvent là que sortent les scoops.
En entreprise
La veille IA n'est qu'un cas parmi d'autres. La même mécanique surveille des concurrents, une réglementation, les appels d'offres d'un secteur : une recherche au bon endroit au bon rythme, un tri sur l'essentiel, un résumé qui arrive là où l'équipe le lira.