Un sistema di ragionamento più ampio all'interno di un involucro di bordo incorporato
Reinventy ha promosso NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4 come motore di ragionamento canonico in Odino 3.11.0/Q19 su NVIDIA Jetson AGX Thor. TensorRT Edge-LLM 0.10.0 serve il modello di produzione; il precedente motore Nano è inattivo e non è abilitato il fallback automatico o il selettore del modello.
Nemotron 3.5 è un modello misto di esperti da 30 miliardi con circa 3 miliardi di parametri attivi per token. Fornisce 7,5 volte la capacità di parametri totale del precedente motore Nano-4B pur mantenendo un ingombro di calcolo attivo contenuto adatto a una piattaforma embedded accelerata.
Prestazioni produttive
Rispetto alla linea di base Nano comparabile sostenuta, Odino 3.11 registra:
- 72.623 tok/s nella media HTTP di produzione a cinque esecuzioni, con un miglioramento del 27,6%;
- 77.104 tok/s sul carico di lavoro HTTP fisso qualificato, con un miglioramento del 35,5%;
- 92,8 tok/s al picco del motore nativo, con un miglioramento del 63,1%;
- Tempo medio per la prima produzione del contenuto: 68,072 ms.
Il motore di produzione occupa 19.102 MiB di memoria unificata GPU a piena residenza. Un riavvio supervisionato del motore caldo riporta la prontezza in quattro secondi.
Ragionamento scientifico e prove dirette
Sullo stesso manifesto scientifico e contraddittorio bilingue fisso, la precisione misurata è aumentata dal 63,33% al 100%. Direct Evidence p50 è sceso da 3.556,867 ms a 31,370 ms e la precedente richiesta di catalogo che superava il limite HTTP ora viene completata correttamente con una traccia dello strumento con messa a terra su 236 righe di catalogo.
Knowledge Graph, provenienza a livello di dichiarazione, valutazione delle prove, incertezza locale e gestione fuori dominio, strumenti radicati e consumatori specializzati di sola lettura rimangono integrati senza consentire la mutazione, l'esportazione, l'acquisizione o l'esecuzione autonoma di esperimenti.
Questo traguardo dimostra la tesi fondamentale di Reinventy: un ragionamento più capace non implica necessariamente dipendenza dal cloud, autorità nascosta o esecuzione illimitata. Prestazioni, prove e governance possono progredire insieme su un nodo edge accelerato NVIDIA.
Fonti: Odino 3.11.0 / Record di produzione governata Q19 · verificato il 23-08-2026