Una nota de vigilancia tecnológica fechada el 7 de agosto de 2026 que interpreta Shieldstral 1.0 3B — el clasificador de seguridad multimodal lanzado por Mistral AI el 4 de agosto bajo licencia Apache 2.0 — como la traducción, en forma de producto, de una postura política.
La paradoja de partida. El 13 de mayo de 2026, ante la comisión de investigación de la Asamblea Nacional francesa sobre las vulnerabilidades digitales, Arthur Mensch rechazó cualquier supervisión por parte de Mistral sobre el uso final de sus modelos: «no tenemos legitimidad democrática», descartando de paso la postura de Anthropic. Menos de tres meses después, Mistral lanza un modelo de moderación. El autor disuelve la contradicción: Shieldstral no lleva incorporada ninguna taxonomía de lo lícito y lo ilícito — responde a una pregunta que escribe el desplegador.
Apache 2.0, 16 GB de VRAM, y la responsabilidad enviada junto con los pesos.
El mecanismo. El prompt se estructura en tres partes: contexto y gravedad, una única pregunta cerrada, el contenido a evaluar. El modelo responde yes o no y la softmax sobre estos dos tokens produce una puntuación continua. La política, por tanto, no se aprende: mientras que Llama Guard 4 incorpora la taxonomía de MLCommons congelada en el momento del entrenamiento, Shieldstral lee la tuya en lenguaje natural en el momento de la inferencia, modificable sin reentrenamiento. El informe técnico (arXiv, 28 de julio) cuantifica esta elección: 61,1% de F1 de adaptabilidad únicamente con conjuntos de prueba públicos, +23,3 puntos gracias a 4,4 millones de pares contrastivos generados por un LLM, 91,3% tras la fusión de tres checkpoints. El objeto está dimensionado para funcionar on-premises: 3.800 millones de parámetros, base Ministral 3 y codificador de visión Pixtral, 12 idiomas, 16 GB de VRAM. En texto, 84,9% de F1 promedio — a la par con GPT-OSS-Safeguard-20B, siete veces más grande. ⚠️ Reserva planteada por el autor: cifras del proveedor, conjuntos de prueba del proveedor, sin evaluación de terceros.
La tesis. Dos lugares posibles para alojar la barrera de seguridad. En Anthropic (9 de junio), reside en los pesos y el proveedor decide quién queda exento de ella — Claude Fable 5 público, Claude Mythos 5 reservado a los ciberdefensores de Project Glasswing. En Mistral, se sitúa fuera del modelo: un componente separado, abierto, autohospedable. Una elección alineada con los clientes del sector soberano y bancario, y con una soberanía que se cualifica dependencia por dependencia.
El reverso. Tres carencias documentadas: auditabilidad (salida binaria, sin traza de razonamiento, mientras que el desplegador carga con la responsabilidad de justificación en una auditoría de la AI Act), robustez (el Tratado sobre la tolerancia de Voltaire clasificado como «incitación a la violencia» — confusión entre mención y respaldo), disponibilidad (ni endpoint de pago ni Ollama oficial a fecha del 6 de agosto). De ahí tres reglas: calibrar dos umbrales sobre un conjunto de prueba interno, registrar la pregunta de política activa, probar la mención/respaldo y tus idiomas — y mantener un detector de inyección de prompt independiente. «Apache 2.0, 16 GB de VRAM, y la responsabilidad enviada junto con los pesos.»