Dola Seed 2.0 Lite passe en omni-modal et muscle l'Agent, le Coding et le GUI
BytePlus lance Dola Seed 2.0 Lite, un modèle omni-modal doté de 262k tokens de contexte, optimisé pour l'Agent, le Coding et le GUI sur la plateforme ModelArk.
BytePlus pousse une mise à jour de Dola Seed 2.0 Lite, la version intermédiaire de la famille Seed de ByteDance distribuée à l'international, qui devient le premier modèle omni-modal de la série. Le modèle comprend désormais nativement vidéo, image, audio et texte dans une même architecture, et accompagne ce passage à l'omnimodalité d'améliorations sur trois fronts : Agent, Coding et GUI.
En raisonnement cross-modal, le modèle peut vérifier la cohérence entre une bande son et une vidéo, repérer des moments clés à partir d'une consigne en langage naturel, suivre des personnes ou des événements dans la durée, et analyser l'émotion, les sons d'ambiance ou les détails musicaux au-delà de la simple transcription. La partie audio reconnaît la parole dans 19 langues et traduit entre le chinois, l'anglais et 14 autres. Sur la vision, BytePlus revendique des gains marqués en raisonnement physique et médical, en perception fine et en compréhension incarnée.
Le volet Agent et Coding élargit les capacités de suivi d'instructions longues, de décomposition de tâches et d'auto-vérification, avec une intégration travaillée pour des frameworks comme OpenClaw et Hermes Agent. La génération de pages front-end, les scènes 3D et les prototypes de jeu gagnent en qualité visuelle et en complétude. Le module GUI, qui détecte boutons, menus, formulaires et états d'interface, ajoute une couche d'action (clic, saisie, scroll, drag & drop), ce qui rend le modèle exploitable pour des workflows Browser Use et Computer Use de bout en bout.
Sur les benchmarks publics, Dola Seed 2.0 Lite revendique des scores SOTA ou proches : BabyVision 64,7 %, VideoMME 89,0, LongVideoBench 79,0, OmniVideoBench 61,7, MedXpertQA-MM 79,6, HiPhO 83,8, GPQA Diamond 88,4 %. Le modèle est accessible via la plateforme BytePlus ModelArk avec une fenêtre de contexte de 262 000 tokens, autour de 0,25 $ par million de tokens en entrée et 2 $ en sortie.