Dix millions de tokens sans mémoire externe pour Vast-10M

Voltropy présente Vast-10M, une famille de LLM dotée d’un contexte natif de 10 millions de tokens. Sa technologie Voltropy Scalable Attention modifie l’attention de modèles existants et, selon les tests BEAM publiés par l’entreprise, améliore aussi leur raisonnement sur des contextes plus courts.

Dix millions de tokens réellement testés

Afficher une fenêtre de contexte de 10 millions de tokens ne dit pas si un modèle reste capable d’exploiter les informations placées à l’intérieur. C’est précisément ce que Voltropy cherche à mesurer avec Vast-10M.

La famille comprend trois modèles. Vast-10M-Flash dérive de DeepSeek V4.0 Flash, Vast-10M-Pro de DeepSeek V4.0 Pro et Vast-10M-Medium de GLM-5.2. Dans chaque cas, le mécanisme d’attention du modèle d’origine est remplacé par Voltropy Scalable Attention, ou VSA.

Les trois versions atteignent 10 millions de tokens de contexte natif sans RAG ni système de mémoire externe. Le rapport technique de Vast-10M évalue ensuite leur comportement de 100 000 à 10 millions de tokens avec BEAM, un benchmark consacré au raisonnement et à la mémoire sur de très longs contextes. Changer l’attention d’un modèle existant

VSA est conçu pour être greffé sur des Transformers existants plutôt que d’exiger la création d’un modèle entièrement différent.

Les résultats publiés par Voltropy montrent un phénomène moins attendu : les versions modifiées ne progressent pas uniquement lorsque le contexte devient immense. Elles dépassent systématiquement leurs modèles d’origine à 100K, 500K et 1M tokens.

Vast-10M-Flash passe par exemple de 43,71 à 52,66 points sur BEAM à 100K tokens face à DeepSeek V4.0 Flash. À 1M, l’écart passe de 39,69 à 48,73 points. Vast-10M-Pro et Vast-10M-Medium enregistrent eux aussi des gains sur les trois longueurs testées.

Voltropy attribue ces différences à VSA. Le rapport précise que l’adaptation nécessite un entraînement supplémentaire, ce qui constitue une variable potentiellement confondante. Les auteurs indiquent toutefois que la quantité de réentraînement nécessaire était limitée pour les familles étudiées. 48,73 points face à Fable 5.1 et GPT-6 Astra

À 1 million de tokens, Vast-10M-Flash obtient 48,73 points sur BEAM. Claude Fable 5.1 atteint 44,03 et GPT-6 Astra 49,75 dans les résultats rapportés par Voltropy.

L’écart avec Fable 5.1 atteint donc 4,70 points. Face à Astra, Vast-10M-Flash obtient 97,95 % de son score sur cette évaluation.

Le résultat est d’autant plus notable dans le protocole de Voltropy que DeepSeek V4.0 Flash, utilisé comme base, n’atteint que 39,69 points à cette même longueur de contexte. Sa version équipée de VSA dépasse également DeepSeek V4.1 Flash à 100K, 500K et 1M tokens.

Ces comparaisons proviennent du rapport de Voltropy et n’ont pas fait l’objet d’une évaluation indépendante. 40,20 points lorsque le contexte atteint 10 millions

La dégradation devient visible lorsque Vast-10M-Flash passe de 1 à 10 millions de tokens, mais le modèle conserve 82,49 % de son score BEAM : 48,73 points à 1M contre 40,20 à 10M.

Ce dernier résultat dépasse légèrement les 39,69 points obtenus par son modèle d’origine DeepSeek V4.0 Flash à seulement 1M tokens. Il se rapproche aussi des 40,49 points de GLM-5.2 à 500K tokens.

Vast-10M-Pro obtient 36,09 points à 10M et Vast-10M-Medium 32,74. Voltropy affirme que les 40,20 points de Flash constituent le meilleur résultat publié pour un LLM sans assistance sur le niveau 10M de BEAM. Le rapport ne fournit pas de validation indépendante de cette revendication. Un benchmark complet, avec quelques limites

Voltropy indique avoir exécuté l’intégralité des tests BEAM : 400 questions à 100K tokens, 700 à 500K, 700 à 1M et 200 à 10M. GPT-4.1 mini sert de juge avec une température réglée à zéro.

Comparer directement les différents niveaux demande une précaution. Les questions ne sont pas strictement identiques d’un palier de contexte à l’autre, même si BEAM cherche à produire des ensembles de difficulté comparable.

Fable 5.1 et GPT-6 Astra n’ont par ailleurs été évalués que jusqu’à 1 million de tokens, conformément aux fenêtres de contexte prises en compte par les auteurs. Il n’existe donc pas dans ce rapport de comparaison Astra ou Fable face à Vast-10M sur le palier 10M.

L’accès anticipé à Vast-10M est ouvert depuis le site de Voltropy.