Aller au contenu

root / tags / google-deepmind

#Google DeepMind

4 fiches

Agent Plugins package your skills, tools, and more

Annonce **Google** du **6 août 2026** : Google rejoint comme **Core Maintainer** la spécification **Agent Plugins 1.0.0**, format d'empaquetage ouvert et *vendor-neutral* pour distribuer ensemble des **Agent Skills** et des **serveurs MCP**. La spécification a été publiée par un **TSC** dont les Core Maintainers viennent d'**Amazon, Cursor, Microsoft, OpenAI et Vercel** ; Google s'y ajoute, représenté par **Kevin Hou** (Senior Staff Engineer, Google DeepMind). Les deux briques empaquetées — Agent Skills et MCP — sont d'origine **Anthropic**, qui ne figure pas dans cette liste de mainteneurs. **Le diagnostic** tient en une phrase : *« The core problem isn't the components. It's the manifest. »* Une skill est portable, un serveur MCP est portable ; la boîte dans laquelle on les met ne l'est pas, et chaque client a dû l'inventer pour lui-même — d'où les forks, les copies de composants identiques et leur dérive. **Le format** tient en une contrainte : *« A plugin is a directory. That's the whole idea, and the restraint is the point. »* Un `plugin.json` à deux lignes utiles (`$schema` et `name`), des skills dans `skills/` au format Agent Skills, des serveurs déclarés dans `mcp.json` avec un **`type` explicite sur chaque entrée** (stdio, Streamable HTTP, ou HTTP+SSE historique) — plus de transport deviné à la forme de l'objet de configuration. La force du design est dans ce que le manifeste **ne peut pas** faire : ni déplacer les composants, ni les déclarer en ligne, donc aucun chemin de découverte à configurer et aucun ordre de précédence à apprendre. Corollaire opérationnel : les composants **échouent indépendamment** — un serveur `mcp.json` qui ne démarre pas n'emporte pas les skills du plugin, le client saute l'entrée, continue et signale l'échec. L'échappatoire assumée est le répertoire en **domaine inversé** (`com.example.client/`), espace d'extension appartenant entièrement à un client (hooks, agents, commandes) que les autres ignorent : *« le cœur portable reste petit parce que les parties non portables ont un endroit légitime où aller »*. Une section est consacrée aux cas où le format ne se justifie pas — *« Not every skill should be a Plugin »* : un seul serveur MCP vers un seul client, `mcp.json` suffit ; une seule skill, pas besoin de plugin. Ce que la v1 exclut explicitement, en *future considerations* : **aucun mécanisme d'installation, aucun protocole de distribution, aucun modèle de permissions, aucune exigence de bac à sable, aucune vérification de confiance ou de provenance, aucune UX**. Le tout s'insère dans une pile à quatre couches indépendamment adoptables — **trouver** (Agentic Resource Discovery), **décrire** (AI Catalog, qui enregistrerait le type `application/agent-plugins+json`), **empaqueter** (Agent Plugins), **exécuter** (MCP + Agent Skills). Deux produits Google livrent déjà : **Agents CLI** et **Data Agent Kit** (BigQuery, Spanner, Cloud SQL).

#Agent Plugins#Agent Plugins 1.0.0#spécification ouverte

Trois signataires · répartis sur trois entités Google :

Recherche & Éducation

Diffusion Language Models Explained: How Google's Diffusion Gemma Works

Article pédagogique du **MindStudio Team** (blog de la plateforme MindStudio, orchestration de workflows multi-modèles) expliquant les **modèles de langage par diffusion** (*Diffusion Language Models*) à travers le cas de **Diffusion Gemma**, première implémentation **open weights** de Google (2B paramètres, dérivée de Gemma 2). La thèse : là où les modèles **autorégressifs** (GPT-4, Claude, Gemma standard) génèrent le texte **token par token, de gauche à droite** (attention causale, chaque token figé une fois produit), les modèles par **diffusion** partent d'une séquence **masquée/bruitée** et la **raffinent itérativement** (diffusion masquée / *absorbing diffusion*), avec **attention bidirectionnelle** : le modèle peut **réviser n'importe quelle position à n'importe quelle étape**. Conséquences : **parallélisme** élevé (un texte de 500 tokens nécessiterait 50-100 étapes de débruitage au lieu de 500 passes séquentielles), **infilling** et **génération sous contraintes** naturels (remplissage de templates, complétion de code avec contexte environnant), et capacité de **révision intégrée**. Mais à l'échelle actuelle (2B), Diffusion Gemma **ne rivalise pas** avec les grands autorégressifs (GPT-4o, Gemini 1.5 Pro) sur le raisonnement, le suivi d'instructions et les connaissances générales : l'écart « se referme » sans être comblé. L'inspiration vient de l'image (Stable Diffusion, DALL-E ont quitté l'autorégressif il y a des années) ; reste à savoir si le principe tient pour le texte. Diffusion Gemma est distribuée sur Hugging Face (Google DeepMind), AI Studio et Vertex AI.

#modèles de langage par diffusion#Diffusion Gemma#Google DeepMind

MindStudio Team