Baidu opens Unlimited OCR, which reads dozens of pages at once

Baidu launches Unlimited OCR, an end-to-end model using R-SWA and DeepSeek-OCR to transcribe over forty pages in a single pass with top OmniDocBench scores.

Baidu dévoile Unlimited OCR, un modèle d'OCR de bout en bout conçu pour transcrire de longs documents en une seule passe, là où les modèles existants traitent page par page en réinitialisant leur mémoire à chaque étape. Le code et les poids sont publiés sur GitHub et Hugging Face, et un rapport technique accompagne la publication.

L'innovation réside dans un mécanisme d'attention que Baidu nomme Reference Sliding Window Attention (R-SWA), inspiré de la façon dont un humain recopie un texte : il garde la source sous les yeux en permanence, ne retient que les quelques derniers mots écrits et oublie doucement le reste. Concrètement, les tokens visuels de l'image restent toujours accessibles tandis que, côté texte généré, le modèle n'attend que la fenêtre des cent vingt-huit derniers tokens. La taille du cache KV demeure ainsi constante au fil de la génération, au lieu de croître, ce qui stabilise la mémoire et la vitesse même sur de longs documents. Le modèle s'appuie sur la base DeepSeek-OCR, une architecture MoE de 3 milliards de paramètres dont 500 millions activés.

Baidu revendique des résultats de premier plan sur le banc d'essai OmniDocBench, autour de 93 sur les versions 1.5 et 1.6, soit six points de mieux que la base DeepSeek-OCR sur la 1.5, avec des gains en texte, formules, tableaux et ordre de lecture, et une transcription maintenue jusqu'à plus de quarante pages en un passage. R-SWA, ajoute l'entreprise, est valable au-delà de l'OCR, pour la reconnaissance vocale ou la traduction.