Un sistema di ragionamento più ampio all'interno di un involucro di bordo incorporato

Reinventy ha promosso NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4 come motore di ragionamento canonico in Odino 3.11.0/Q19 su NVIDIA Jetson AGX Thor. TensorRT Edge-LLM 0.10.0 serve il modello di produzione; il precedente motore Nano è inattivo e non è abilitato il fallback automatico o il selettore del modello.

Nemotron 3.5 è un modello misto di esperti da 30 miliardi con circa 3 miliardi di parametri attivi per token. Fornisce 7,5 volte la capacità di parametri totale del precedente motore Nano-4B pur mantenendo un ingombro di calcolo attivo contenuto adatto a una piattaforma embedded accelerata.

Prestazioni produttive

Rispetto alla linea di base Nano comparabile sostenuta, Odino 3.11 registra:

  • 72.623 tok/s nella media HTTP di produzione a cinque esecuzioni, con un miglioramento del 27,6%;
  • 77.104 tok/s sul carico di lavoro HTTP fisso qualificato, con un miglioramento del 35,5%;
  • 92,8 tok/s al picco del motore nativo, con un miglioramento del 63,1%;
  • Tempo medio per la prima produzione del contenuto: 68,072 ms.

Il motore di produzione occupa 19.102 MiB di memoria unificata GPU a piena residenza. Un riavvio supervisionato del motore caldo riporta la prontezza in quattro secondi.

Ragionamento scientifico e prove dirette

Sullo stesso manifesto scientifico e contraddittorio bilingue fisso, la precisione misurata è aumentata dal 63,33% al 100%. Direct Evidence p50 è sceso da 3.556,867 ms a 31,370 ms e la precedente richiesta di catalogo che superava il limite HTTP ora viene completata correttamente con una traccia dello strumento con messa a terra su 236 righe di catalogo.

Knowledge Graph, provenienza a livello di dichiarazione, valutazione delle prove, incertezza locale e gestione fuori dominio, strumenti radicati e consumatori specializzati di sola lettura rimangono integrati senza consentire la mutazione, l'esportazione, l'acquisizione o l'esecuzione autonoma di esperimenti.

Questo traguardo dimostra la tesi fondamentale di Reinventy: un ragionamento più capace non implica necessariamente dipendenza dal cloud, autorità nascosta o esecuzione illimitata. Prestazioni, prove e governance possono progredire insieme su un nodo edge accelerato NVIDIA.

Fonti: Odino 3.11.0 / Record di produzione governata Q19 · verificato il 23-08-2026