Un système de raisonnement plus large à l'intérieur d'une enveloppe de bord intégrée

Reinventy a promu NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4 comme moteur de raisonnement canonique dans Odino 3.11.0/Q19 sur NVIDIA Jetson AGX Thor. TensorRT Edge-LLM 0.10.0 sert le modèle de production ; l'ancien moteur Nano est inactif et aucun repli automatique ni sélecteur de modèle n'est activé.

Nemotron 3.5 est un modèle de mélange d'experts de 30 milliards de paramètres avec environ 3 milliards de paramètres actifs par jeton. Il fournit 7,5 fois la capacité totale de paramètres de l'ancien moteur Nano-4B tout en conservant une empreinte de calcul actif contenue adaptée à une plate-forme embarquée accélérée.

Performances de production

Par rapport à la base de référence Nano comparable et soutenue, Odino 3.11 enregistre :

  • 72,623 tok/s sur la moyenne HTTP de cinq exécutions de production, soit une amélioration de 27,6 % ;
  • 77.104 tok/s sur la charge HTTP fixe qualifiée, soit une amélioration de 35,5% ;
  • 92,8 tok/s au pic du moteur natif, soit une amélioration de 63,1 % ;
  • Temps médian de 68,072 ms pour le premier contenu de production.

Le moteur de production occupe 19 102 Mio de mémoire unifiée GPU en résidence complète. Un redémarrage supervisé du moteur à chaud rétablit l'état de préparation en quatre secondes.

Raisonnement scientifique et preuves directes

Sur le même manifeste scientifique et contradictoire bilingue fixe, la précision mesurée est passée de 63,33 % à 100 %. Direct Evidence p50 est passé de 3 556,867 ms à 31,370 ms, et l'ancienne requête de catalogue qui dépassait la limite HTTP se termine désormais avec succès avec une trace d'outil mise à la terre sur 236 lignes de catalogue.

Knowledge Graph, provenance au niveau des revendications, évaluation des preuves, incertitude locale et gestion hors domaine, outils ancrés et consommateurs spécialisés en lecture seule restent intégrés sans permettre la mutation, l'exportation, l'ingestion ou l'exécution d'expériences autonomes.

Cette étape démontre la thèse fondamentale de Reinventy : un raisonnement plus efficace n'implique pas nécessairement une dépendance au cloud, une autorité cachée ou une exécution illimitée. Les performances, les preuves et la gouvernance peuvent progresser ensemble sur un seul nœud périphérique accéléré NVIDIA.

Sources : Odino 3.11.0 / Dossier de production régi par Q19 · vérifié le 23/08/2026