ODINO 3.11 · NEMOTRON 3.5 LIGHTNING · PRODUZIONE LIVE
Capacità di trenta miliardi di parametri.Sostenuto al limite sovrano.
Odino 3.11 promuove NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4 alla produzione su un singolo NVIDIA Jetson AGX Thor. Il modello Mixture-of-Experts da 30 miliardi attiva circa 3 miliardi di parametri per token: 7,5 volte la capacità totale del precedente modello Nano-4B, con un throughput di produzione sostenuto di 72,623 tok/s e un tempo medio di 68,072 ms per il primo contenuto.
IL VINCOLO
Più capacità, all’interno della stessa macchina sovrana.
Jetson AGX Thor 5000 fornisce 128 GiB di memoria unificata: sostanziale per un nodo periferico, limitata per un sistema cognitivo multimodale completo. Odino è iniziato come la risposta a quel limite difficile delle risorse. Il suo attuale motore di produzione ora detiene un modello MoE da 30 miliardi con residenza UMA GPU da 19.102 MiB mentre Nemotron Omni, Riva Speech e la flotta di servizio governata rimangono attivi.
L'anticipo non è uno scambio di modelli simili. Nemotron 3.5 Lightning offre una capacità di parametri totale 7,5 volte maggiore rispetto a Nano-4B attivando circa 3B parametri per token. Ciò preserva un’impronta di calcolo attivo relativamente contenuta ed espande materialmente la capacità di ragionamento scientifico del sistema.
Q19 · ANDAMENTO DELLA PRODUZIONE · 23 AGOSTO 2026
+28% sostenuto. +36% qualificati. Fino al +63% nativo.
Il titolo utilizza come riferimento l'ultimo risultato Odino Nano sostenuto e comparabile. Tutte le misurazioni vengono eseguite sullo stesso Jetson AGX Thor; I risultati HTTP qualificati e nativi utilizzano il carico di lavoro fisso Q18, mentre il dato di produzione è la media di cinque esecuzioni HTTP.
72.623
TOK/S · PRODUCTION
77.104
TOK/S · QUALIFICATO HTTP
92.8
TOK/S · PICCO NATIVO
68,072 ms
PRIMO CONTENUTO MEDIANO
| Carico di lavoro | Linea di base Nano comparabile | Odino3.11 | Miglioramento |
|---|---|---|---|
| Produzione sostenuta · HTTP a cinque esecuzioni | 56.895 tok/s | 72.623 tok/s | +27.6% |
| HTTP qualificato · carico di lavoro Q18 corretto | 56.895 tok/s | 77.104 tok/s | +35.5% |
| Motore nativo · carico di lavoro Q18 fisso | 56.895 tok/s | 92,8 tok/s | +63.1% |
| Tempo per il primo contenuto · mediana di produzione | — | 68,072 ms | CURRENT |
Limite del metodo: un'esecuzione precedente del primo trimestre ha registrato 97.651 tok/s su un carico di lavoro breve e misto. Non viene utilizzato come comparatore diretto perché prompt, modello, runtime e metodologia differiscono.
RISULTATO DEL SISTEMA · STESSO MANIFESTO SCIENTIFICO Q9
Il risultato più grande è la capacità e l’affidabilità scientifica.
Sul benchmark scientifico e contraddittorio bilingue fisso, Odino ora chiude ogni caso misurato. La prova diretta deterministica gestisce domande esatte su grafici, processi e numeri con porte di provenienza e zero chiamate LLM.
| Metrico | Riferimento Q9 | Sistema attuale | Cambiare |
|---|---|---|---|
| Precisione scientifica · risolto il manifest Q9 | 63.33% | 100% | +36,67 punti · +57,9% relativo |
| Latenza della prova diretta · p50 | 3.556,867 ms | 31.370 ms | −99,1% · 113,38 volte più veloce |
| Richiesta catalogo radicato | HTTP413 | HTTP 200 · 5,73 s | Traccia utensile reale · 236 righe |
Knowledge Graph, provenienza a livello di dichiarazione, valutazione delle prove, UQ/OOD locale, strumenti radicati e consumatori specializzati di sola lettura ora formano un unico percorso di prova governato. Il grafo di produzione contiene 259 nodi e 246 archi.
Queste funzionalità sono state aggiunte senza consentire la mutazione, l'esportazione, l'acquisizione o l'esecuzione autonoma degli esperimenti. Le invarianti del workbench e dell'archivio vettoriale, la politica del Guardian, il kill switch e i confini dell'autorità umana rimangono intatti.
FONDAZIONE STORICA · FASE 1
I numeri che hanno giustificato la realizzazione.
La tabella seguente confronta Odino Fase 1 con la precedente configurazione vLLM sullo stesso hardware Jetson AGX Thor 5000, eseguendo lo stesso modello di chat quantizzata FP8. Convalidato il 06-12-2025.
| Metrico | vLLM (precedente) | Odino Fase 1 (convalidata) | Δ rispetto a vLLM | Odino Sprint 3 streaming |
|---|---|---|---|---|
| Occupazione della memoria (inattiva) | ~67 GiB | 381 MiB | −99.4% | ~381 MiB (invariato) |
| Occupazione della memoria (caricata) | ~70 GiB (saturo) | ~15 GiB | −78% | ~15 GiB (invariato) |
| Orario di partenza a freddo | 30-60 secondi | < 2 secondi | −96% | Motore < 2 s + riscaldamento alla prima chiamata |
| TTFT in streaming | n/d | n/d | n/d | stato stazionario caldo entro la banda inferiore a 200 ms |
| Supporto interattivo | n/d | solo sincrono | n/d | SSE token per token |
La memoria recuperata - circa 50 GiB liberati dal confronto dello stato caricato - è ciò che consente al cluster Tin Man di gestire i core Vision (RADIO ViT-H/16), Audio (Parakeet Conformer) e Real-time insieme al core di ragionamento su un singolo nodo Jetson Thor.
PRINCIPI DI INGEGNERIA
Compilazione nativa. Residenza vincolata. Operazione governata.
Tre decisioni architettoniche, applicate uniformemente:
- Compilazione nativa di ThorUn motore TensorRT Edge-LLM 0.10.0 compilato per Jetson AGX Thor esegue Nemotron 3.5 Lightning in NVFP4, senza un framework di servizio generico nel percorso di inferenza.
- Residenza vincolataIl motore di produzione risiede completamente con 19.102 MiB di memoria unificata GPU mentre lo stack multimodale più ampio rimane operativo.
- Percorso produttivo governatoL'endpoint del modello canonico è fisso, il precedente motore Nano è inattivo, gli strumenti di mutazione rimangono disabilitati e la disponibilità supervisionata viene testata sull'intero stack.
Ogni decisione riflette il ruolo di Odino come runtime di ragionamento appositamente creato per Tin Man su questo hardware specifico, piuttosto che come framework di inferenza per scopi generali.
DETERMINISM
Percorsi di evidenza prima di percorsi generativi.
Oltre al throughput grezzo, Odino instrada domande esatte su grafici, numerici e processi attraverso un percorso deterministico di prova diretta. Tali risposte portano prove e provenienza locali limitate, ignorano la generazione e richiedono zero chiamate LLM. Il ragionamento ambiguo rimane sul percorso del modello governato piuttosto che essere travisato come prova deterministica.
L’architettura mantiene visibile la distinzione: i fatti supportati dall’evidenza, il ragionamento del modello e i risultati degli strumenti mantengono una provenienza separata. Shield Brain e il confine dell'autorità umana si applicano a ogni percorso, mentre gli strumenti mutanti e l'esecuzione autonoma degli esperimenti rimangono disabilitati.
INTEGRATION
Un componente, non un prodotto.
Odino non viene consegnato come prodotto autonomo. È l'Chat Core del cluster cognitivo Tin Man, lo strato di ragionamento che interpreta gli input in modalità testo e produce l'assemblaggio rapido multimodale consumato dai core a valle. Il suo valore si realizza attraverso l'integrazione con i core Vision, Audio, Brainstem, Memory e Realtime nell'ambito dell'architettura di controllo Shield Brain.
La linea di produzione 3.11 espone un endpoint canonico Nemotron 3.5 senza fallback automatico del modello. I suoi consumatori scientifici di sola lettura, gli strumenti radicati e i percorsi di prova deterministica condividono lo stesso confine del Guardian e dell’autorità umana; le operazioni di mutazione rimangono disabilitate.
MIGLIORAMENTO SPRINT 3 · MAGGIO 2026
Consegna in streaming token per token.
Nel maggio 2026 il runtime Odino è stato esteso con il supporto dello streaming lato server, consentendo al cluster Tin Man di pipeline la generazione di token del modello linguistico con livelli di sintesi downstream (sintesi vocale) e di ridurre la latenza del loop vocale end-to-end ben al di sotto di 1 secondo.
La compatibilità con le versioni precedenti con l'endpoint sincrono della Fase 1 viene preservata. Lo streaming viene implementato tramite eventi inviati dal server compatibili con OpenAI, fornendo output incrementale per token.
Prestazione empirica:
- Time-To-First-Token in stato stazionario: ben all'interno della fascia target inferiore a 200 ms
- Risposta coerente sul corpus di comando dei droni a livello interattivo
Il progetto del motore Golden Master della Fase 1 è mantenuto invariato; il comportamento dello streaming viene ottenuto tramite un cablaggio del server variante che vincola lo stesso piano del motore in fase di esecuzione: un modello di provenienza progettato per mantenere stabili le risorse convalidate durante i miglioramenti iterativi.
ENGAGE
Approfondimenti tecnici vengono rilasciati nell'ambito della partnership.
Il rapporto tecnico completo Odino, i manifesti dei benchmark, le note di integrazione per il cluster Tin Man, le prove di costruzione del motore e il percorso di ingegneria dell'intelligenza artificiale incorporata vengono rilasciati in base ad un accordo di non divulgazione. Contattaci per avviare una conversazione.
Diretto: engage@reinventy-solutions.ca