Des formulaires manuscrits aux tableaux complexes, Sarvam Vision 2.1 étend son OCR documentaire
Sarvam AI fait évoluer son modèle de document intelligence avec Sarvam Vision 2.1. Cette version ajoute l’extraction structurée de tableaux et formulaires, la reconnaissance manuscrite des langues indiennes et améliore les performances du système sur plusieurs benchmarks OCR.
Du document à la donnée structurée
Lire correctement une page ne suffit plus lorsqu’il faut ensuite retrouver une valeur dans un formulaire ou reconstruire un tableau réparti sur plusieurs pages. Sarvam Vision 2.1 étend son périmètre à ces traitements avec l’extraction de paires clé-valeur, l’analyse de tableaux complexes et la reconnaissance de contenus manuscrits dans les langues indiennes.
La première version se concentrait déjà sur l’OCR multilingue, les tableaux, le raisonnement visuel et les sorties structurées. Sarvam AI indique avoir retravaillé les hallucinations et certaines incohérences observées depuis sa sortie, tout en optimisant l’infrastructure d’inférence afin de réduire le coût de fonctionnement. Un VLM entouré de composants spécialisés
L’architecture conserve le principe utilisé par la version précédente. Le VLM peut traiter directement une page ou un document, mais Sarvam l’associe à un analyseur de mise en page sémantique et à un système chargé de déterminer l’ordre de lecture.
Pour les nouvelles fonctions, l’entreprise a constitué des ensembles de données synthétiques et réels consacrés aux formulaires, à l’extraction clé-valeur et aux écritures manuscrites indiennes. Des formulaires imprimés ou manuscrits ont notamment été générés dans plusieurs langues, puis complétés par des documents provenant du web.
L’entraînement supplémentaire combine supervised fine-tuning et RLVR. 87,3 sur olmOCR-Bench
Sur l’ensemble officiel d’olmOCR-Bench, Sarvam AI rapporte un score de 87,30 pour Vision 2.1. Infinity-Parser2 Pro atteint 86,10, Opus 5 85,10 et la première version de Sarvam Vision 84,10 dans la même évaluation.
Le benchmark couvre plusieurs difficultés documentaires, dont les formules mathématiques, les anciens scans, les tableaux, les pages multicolonnes et les blocs de texte particulièrement petits.
Le classement diffère sur OmniDocBench v1.6, consacré notamment à la fidélité du texte, des structures de tableaux et des formules. PaddleOCR-VL 1.6 y obtient 96,01, devant Sarvam Vision 2.1 à 94,97 et GLM-OCR à 94,71. GPT 6 Astra atteint 93,74 dans les résultats publiés par Sarvam.
Ces deux évaluations sont déjà suffisamment avancées pour que Sarvam AI les considère comme proches de la saturation, et l’entreprise reconnaît elle-même qu’un score élevé ne garantit pas nécessairement la même efficacité sur des documents réels. Un benchmark consacré aux 22 langues indiennes
Sarvam accompagne cette version d’un nouveau benchmark Indic OCR publié sur Hugging Face.
L’ensemble contient 6 909 échantillons, dont 6 609 répartis entre 22 langues indiennes et 300 en anglais. Les documents proviennent de journaux, brochures, manuels et écrits historiques couvrant une période allant du XIXe siècle à aujourd’hui.
Sur ce benchmark, Sarvam Vision 2.1 atteint une précision globale par mot de 87,39 % dans l’évaluation de l’entreprise. Bodhan Indic-OCR obtient 84,94 %, Gemini 3.6 Flash 79,35 %, Google Cloud Vision 71,76 % et Mistral OCR4 69,16 %.
L’intérêt du jeu de données tient aussi à sa publication : les 22 langues peuvent désormais être évaluées sur le même corpus plutôt que d’être ramenées à des benchmarks OCR essentiellement anglophones. L’écriture manuscrite rejoint le traitement documentaire
La reconnaissance manuscrite constitue l’autre extension importante de Vision 2.1. Sarvam AI a utilisé des sources réelles et synthétiques, dont des contenus extraits de vidéos, afin d’augmenter la diversité des écritures rencontrées pendant l’entraînement.
Cette capacité est combinée à l’extraction structurée. Un document peut ainsi contenir des champs imprimés, des réponses manuscrites et des tableaux dont les informations doivent ensuite être converties en données exploitables.
Deux API séparent ces usages. Digitize convertit les documents multipages, tableaux et contenus manuscrits en texte structuré pour l’anglais et les 22 langues indiennes. Extract récupère les paires clé-valeur, tableaux et champs de formulaires pour les intégrer à des workflows documentaires.