Le coding agentique gagne sa famille sous licence MIT

Deep Reinforce lance Ornith-1.0, une famille de LLMs open source sous licence MIT optimisés pour le coding agentique via la méthode de self-scaffolding.

Avec Ornith-1.0, Deep Reinforce propose une famille de LLMs spécialisés dans le coding agentique, du 9B Dense au 397B MoE, en passant par des versions 31B Dense et 35B MoE.

Les modèles sont post-entraînés à partir de Gemma 4 et Qwen 3.5, avec une méthode dite de self-scaffolding : pendant l’entraînement par renforcement, le modèle n’apprend pas seulement à produire une solution, mais aussi à générer le cadre d’exécution qui l’aide à y parvenir. L’idée est de laisser émerger des stratégies propres aux tâches de code, plutôt que de dépendre uniquement de structures conçues à la main. Ornith met en avant des résultats élevés sur Terminal-Bench 2.1, SWE-Bench Verified, SWE-Bench Pro, SWE-Bench Multilingual, NL2Repo, SWE Atlas et ClawEval, avec des comparaisons favorables à d’autres modèles ouverts de taille proche.

L’équipe décrit aussi plusieurs garde-fous contre le reward hacking, notamment des limites fixes sur l’environnement, un contrôle déterministe des actions interdites et un juge LLM figé en surcouche. Tous les modèles sont publiés sous licence MIT, avec usage commercial et recherche autorisés.