Baidu ouvre Unlimited OCR, qui lit des dizaines de pages d'un coup
Baidu lance Unlimited OCR, un modèle open source basé sur DeepSeek-OCR capable de transcrire plus de 40 pages en une seule passe grâce à la méthode R-SWA.
Baidu ouvre Unlimited OCR, un modèle d'OCR de bout en bout pensé pour transcrire de longs documents en une seule passe, là où les modèles existants traitent page par page en réinitialisant leur mémoire à chaque étape. Le code et les poids sont publiés sur GitHub et Hugging Face, et un rapport technique accompagne le tout.
L'innovation tient à un mécanisme d'attention que Baidu nomme Reference Sliding Window Attention (R-SWA), inspiré de la façon dont un humain recopie un texte : il garde la source sous les yeux en permanence, ne retient que les quelques derniers mots écrits et oublie doucement le reste. Concrètement, les tokens visuels de l'image restent toujours accessibles tandis que, côté texte généré, le modèle n'attend que la fenêtre des cent vingt-huit derniers tokens. La taille du cache KV demeure ainsi constante au fil de la génération, au lieu de croître, ce qui stabilise la mémoire et la vitesse même sur de longs documents. Le modèle reprend la base DeepSeek-OCR, une architecture MoE de 3 milliards de paramètres dont 500 millions activés.
Baidu revendique des résultats de premier plan sur le banc OmniDocBench, autour de 93 sur les versions 1.5 et 1.6, soit six points de mieux que la base DeepSeek-OCR sur la 1.5, avec des gains en texte, formules, tableaux et ordre de lecture, et une transcription tenue jusqu'à plus de quarante pages en un passage. R-SWA, ajoute l'entreprise, vaut au-delà de l'OCR, pour la reconnaissance vocale ou la traduction.