Une politique en langage naturel pour modérer texte et images
Shieldstral adapte la modération aux règles de chaque produit, évalue texte et images, et fonctionne sur une seule carte NVIDIA de 16 Go.
Shieldstral est un classificateur de sécurité multimodal de 3 milliards de paramètres, publié en open weights sous licence Apache 2.0. Il évalue des prompts, des réponses, des échanges complets ou des images, avec éventuellement du texte associé.
Plutôt que d’imposer une liste fixe de catégories, le modèle reçoit la politique de modération sous la forme d’une question en langage naturel. Une entreprise peut ainsi lui demander si un contenu encourage une violence ciblée, s’il convient à un public mineur ou si un assistant a correctement refusé une requête, sans réentraîner le modèle à chaque changement de règle.
Chaque requête combine le contexte d’évaluation, une question à réponse binaire et le contenu à examiner. Shieldstral compare ensuite les probabilités associées à « oui » et « non » pour produire un score continu, ajustable selon le niveau de prudence recherché.
Cette même interface couvre la sécurité des textes, la détection des refus, l’adaptation à de nouvelles politiques et la modération multimodale. Mistral indique que le modèle peut fonctionner sur une seule carte NVIDIA dotée de 16 Go de mémoire.
L’entraînement regroupe environ 54,1 millions d’exemples réels et synthétiques issus de taxonomies différentes, convertis dans un format commun. Des paires contrastives apprennent au modèle à distinguer des politiques proches, tandis que les données visuelles sont complétées et filtrées pour réduire les associations incorrectes.
Les premières réactions illustrent le clivage habituel autour des outils de sécurité. Certains développeurs retiennent surtout la possibilité de conserver la modération en local, d’adapter librement les règles et de limiter les ressources nécessaires. D’autres assimilent le produit à un outil de censure, contestent les priorités de Mistral ou regrettent qu’un verdict binaire ne fournisse pas d’explication détaillée sur la raison d’un blocage.