Pokee-Isaac 28B mise sur le très long contexte
Pokee-Isaac 28B combine 10 millions de tokens de contexte, déploiement sur un seul GPU et outils agentiques, avec une API à 0,15 dollar l’entrée.
Pokee-Isaac 28B est un modèle agentique de 28 milliards de paramètres capable de raisonner, planifier et utiliser des outils sur un contexte pouvant atteindre 10 millions de tokens. Son architecture propriétaire n’est pas exclusivement fondée sur un décodeur, mais le rapport ne détaille pas précisément son fonctionnement. Une partie de ses weights provient d’un fine-tuning de Qwen3.6-27B.
Le modèle peut être installé dans un VPC, sur une infrastructure interne ou sur certains appareils, avec une compatibilité annoncée pour vLLM, SGLang et les interfaces proches de l’API d’OpenAI. Pokee indique qu’une seule carte RTX 4090 ou 5090 suffit pour une exécution privée, tandis que les mesures sur le contexte maximal ont été réalisées avec une NVIDIA B200.
Sur RULER, Pokee-Isaac obtient selon l’entreprise 93,3 % avec un contexte de 10 millions de tokens. Sur une B200, l’ingestion de ce volume atteint 137 200 tokens par seconde, avec un délai de 72,9 secondes avant le premier token et une génération maintenue autour de 337 tokens par seconde.
Dans les évaluations agentiques de Pokee, le modèle atteint 70,94 sur BFCL v4, légèrement devant GPT-5.6 Luna à 70,61. Il prend également la première place du panel sur τ³-bench avec 0,662, mais reste derrière GPT-5.6 Luna sur Terminal-Bench 2.1 et derrière Luna et Gemini 3.5 Flash Lite sur MCP-Atlas.
L’accès par API est affiché à 0,15 dollar par million de tokens en entrée et 1 dollar en sortie. Le modèle est actuellement limité au texte, sans prise en charge de l’image, de l’audio ou de la vidéo.