ODINO 3.11 · NEMOTRON 3.5 LIGHTNING · PRODUCTION EN DIRECT
Capacité de trente milliards de paramètres.Soutenu au bord souverain.
Odino 3.11 promeut NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4 en production sur un seul NVIDIA Jetson AGX Thor. Le modèle 30B Mixture-of-Experts active environ 3B paramètres par jeton : 7,5 fois la capacité totale de l'ancien modèle Nano-4B, avec un débit de production soutenu de 72,623 tok/s et un temps médian de 68,072 ms pour le premier contenu.
LA CONTRAINTE
Plus de capacités, au sein de la même machine souveraine.
Jetson AGX Thor 5000 fournit 128 Go de mémoire unifiée – ce qui est substantiel pour un nœud périphérique, limité pour un système cognitif multimodal complet. Odino a commencé comme la réponse à cette limite stricte en matière de ressources. Son moteur de production actuel contient désormais un modèle 30B MoE avec une résidence GPU UMA de 19 102 MiB tandis que Nemotron Omni, Riva Speech et la flotte de services gouvernés restent actifs.
L’avancée n’est pas un échange de modèle à l’identique. Le Nemotron 3.5 Lightning apporte une capacité totale de paramètres 7,5 fois supérieure à celle du Nano-4B tout en activant environ 3B de paramètres par jeton. Cela préserve une empreinte de calcul actif relativement contenue et augmente considérablement la capacité de raisonnement scientifique du système.
Q19 · PERFORMANCES DE PRODUCTION · 23 AOÛT 2026
+28% soutenus. +36% qualifiés. Jusqu'à +63% natif.
Le titre utilise le dernier résultat Odino Nano soutenu et comparable comme référence. Toutes les mesures sont effectuées sur le même Jetson AGX Thor ; Les résultats HTTP qualifiés et natifs utilisent la charge de travail fixe Q18, tandis que le chiffre de production est la moyenne de cinq exécutions HTTP.
72.623
TOK/S · PRODUCTION
77.104
TOK/S · QUALIFIÉ HTTP
92.8
TOK/S · PIC NATIF
68,072 ms
PREMIER CONTENU MÉDIAN
| Charge de travail | Base de référence Nano comparable | Odino 3.11 | Amélioration |
|---|---|---|---|
| Production soutenue · HTTP en cinq exécutions | 56,895 jetons/s | 72,623 jetons/s | +27.6% |
| HTTP qualifié · charge de travail Q18 corrigée | 56,895 jetons/s | 77.104 jetons/s | +35.5% |
| Moteur natif · charge de travail Q18 corrigée | 56,895 jetons/s | 92,8 jetons/s | +63.1% |
| Délai jusqu'au premier contenu · médiane de production | — | 68,072 ms | CURRENT |
Limite de la méthode : une exécution plus ancienne du premier trimestre a enregistré 97,651 tok/s sur une charge de travail courte et mixte. Il n'est pas utilisé comme comparateur direct car l'invite, le modèle, l'exécution et la méthodologie diffèrent.
RÉSULTAT DU SYSTÈME · MÊME MANIFESTE SCIENTIFIQUE Q9
Le résultat le plus important est la capacité et la fiabilité scientifique.
Sur la référence scientifique et contradictoire bilingue fixe, Odino clôture désormais chaque cas mesuré. Deterministic Direct Evidence gère des questions graphiques, de processus et numériques exactes avec des portes de provenance et aucun appel LLM.
| Métrique | Référence Q9 | Système actuel | Changement |
|---|---|---|---|
| Précision scientifique · manifeste Q9 corrigé | 63.33% | 100% | +36,67 points · +57,9% relatif |
| Latence des preuves directes · p50 | 3 556,867 ms | 31,370 ms | −99,1 % · 113,38 × plus rapide |
| Demande de catalogue fondée | HTTP413 | HTTP 200 · 5,73 s | Trace d'outil réelle · 236 lignes |
Knowledge Graph, provenance au niveau des revendications, évaluation des preuves, UQ/OOD local, outils ancrés et consommateurs spécialisés en lecture seule forment désormais un seul chemin de preuves gouverné. Le graphe de production contient 259 nœuds et 246 arêtes.
Ces fonctionnalités ont été ajoutées sans permettre la mutation, l’exportation, l’ingestion ou l’exécution d’expériences autonomes. Les invariants du Workbench et du magasin vectoriel, la politique du Guardian, le kill switch et les limites de l'autorité humaine restent intacts.
FONDATION HISTORIQUE · PHASE 1
Les chiffres qui ont justifié la construction.
Le tableau ci-dessous compare Odino Phase 1 à la configuration vLLM précédente sur le même matériel Jetson AGX Thor 5000, exécutant le même modèle de conversation quantifié FP8. Validé le 06/12/2025.
| Métrique | vLLM (antérieur) | Odino Phase 1 (validé) | Δ contre vLLM | Odino Sprint 3 en streaming |
|---|---|---|---|---|
| Occupation de la mémoire (inactif) | ~67 Gio | 381 Mo | −99.4% | ~ 381 Mio (inchangé) |
| Occupation de la mémoire (chargée) | ~70 Gio (saturé) | ~15 Gio | −78% | ~15 Gio (inchangé) |
| Temps de démarrage à froid | 30 à 60 s | < 2 s | −96% | < 2 s moteur + premier échauffement |
| Diffusion TTFT | n/a | n/a | n/a | état d'équilibre chaud dans la bande inférieure à 200 ms |
| Assistance interactive | n/a | synchrone uniquement | n/a | SSE jeton par jeton |
La mémoire récupérée – environ 50 Gio libérés par la comparaison de l’état chargé – est ce qui permet au cluster Tin Man d’exploiter les cœurs Vision (RADIO ViT-H/16), Audio (Conformateur Parakeet) et de perception en temps réel aux côtés du cœur de raisonnement sur un seul nœud Jetson Thor.
PRINCIPES D'INGÉNIERIE
Compilation native. Résidence délimitée. Fonctionnement régi.
Trois décisions architecturales, appliquées uniformément :
- Compilation native de ThorUn moteur TensorRT Edge-LLM 0.10.0 compilé pour Jetson AGX Thor exécute Nemotron 3.5 Lightning dans NVFP4, sans cadre de service à usage général dans le chemin d'inférence.
- Résidence délimitéeLe moteur de production détient une résidence complète sur 19 102 Mio de mémoire unifiée GPU tandis que la pile multimodale plus large reste opérationnelle.
- Chemin de production gouvernéLe point final du modèle canonique est corrigé, l'ancien moteur Nano est inactif, les outils de mutation restent désactivés et la préparation supervisée est testée sur l'ensemble de la pile.
Chaque décision reflète le rôle de Odino en tant que moteur d'exécution de raisonnement spécialement conçu pour Tin Man sur ce matériel spécifique, plutôt que comme cadre d'inférence à usage général.
DETERMINISM
Les chemins de preuve avant les chemins génératifs.
Au-delà du débit brut, Odino achemine les questions graphiques, numériques et de processus exactes via un chemin déterministe de preuves directes. Ces réponses contiennent des preuves et une provenance locales limitées, contournent la génération et ne nécessitent aucun appel LLM. Le raisonnement ambigu reste sur la voie du modèle gouverné plutôt que d’être présenté à tort comme une preuve déterministe.
L'architecture maintient la distinction visible : les faits étayés par des preuves, le raisonnement du modèle et les résultats des outils conservent une provenance distincte. Shield Brain et la limite de l'autorité humaine s'appliquent à tous les itinéraires, tandis que les outils de mutation et l'exécution d'expériences autonomes restent désactivés.
INTEGRATION
Un composant, pas un produit.
Odino n'est pas livré en tant que produit autonome. Il s'agit du Chat Core du cluster cognitif Tin Man – la couche de raisonnement qui interprète les entrées en mode texte et produit l'assemblage d'invites multimodales consommé par les cœurs en aval. Sa valeur est réalisée grâce à l'intégration des cœurs Vision, Audio, Brainstem, Memory et Realtime sous l'architecture de contrôle Shield Brain.
La ligne de production 3.11 expose un point de terminaison canonique Nemotron 3.5 sans repli automatique du modèle. Ses consommateurs scientifiques en lecture seule, ses outils fondés et ses itinéraires de preuves déterministes partagent la même frontière entre Gardien et autorité humaine ; les opérations de mutation restent désactivées.
AMÉLIORATION DU SPRINT 3 · MAI 2026
Livraison en streaming jeton par jeton.
En mai 2026, le runtime Odino a été étendu avec la prise en charge du streaming côté serveur, permettant au cluster Tin Man de canaliser la génération de jetons de modèle de langage avec des couches de synthèse en aval (texte-parole) et de réduire la latence de la boucle vocale de bout en bout bien en dessous de 1 seconde.
La compatibilité ascendante avec le point de terminaison synchrone de phase 1 est préservée. Le streaming est implémenté via des événements envoyés par le serveur compatibles OpenAI, fournissant une sortie incrémentielle par jeton.
Performances empiriques :
- Temps d'obtention du premier jeton en régime permanent chaud : bien dans la bande cible inférieure à 200 ms
- Réponse cohérente sur le corpus de commande de drones à un niveau interactif
Le plan du moteur Golden Master de la phase 1 est conservé inchangé ; le comportement de streaming est obtenu grâce à un faisceau de serveurs variantes qui lie le même plan de moteur au moment de l'exécution – un modèle de provenance conçu pour maintenir la stabilité des actifs validés lors des améliorations itératives.
ENGAGE
Des plongées approfondies en matière d'ingénierie sont publiées dans le cadre d'un partenariat.
Le rapport technique complet Odino, les manifestes de référence, les notes d'intégration pour le cluster Tin Man, les preuves de construction du moteur et le parcours d'ingénierie de l'IA embarquée sont publiés dans le cadre d'un accord de non-divulgation. Engagez-vous pour démarrer une conversation.
Directement : engage@reinventy-solutions.ca