埋め込まれた端の封筒の中のより大きい推論システム

Reinventyは、 NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4 正式推論エンジンとして Odino 3.11.0/Q19 NVIDIA Jetson AGX Thor. TensorRT Edge-LLMの 0.10.0 は生産モデルを提供します。旧ナノエンジンは非アクティブであり、自動フォールバックやモデルセレクターが有効ではありません。

Nemotron 3.5 は、トークンあたり約 3 億のパラメーターをアクティブにすると、30 億パラメータの混合エキスパートモデルです。 従来のNano-4Bエンジンの総パラメータ容量7.5倍、加速された埋め込まれたプラットフォームに適した組み込み型フットプリントを保持しています。

生産の性能

持続可能な比較可能なナノベースラインに対して、Odino 3.11レコード:

  • 72.623 の tok/s は 5 つの実行生産 HTTP の平均を渡しましたり、27.6% の改善;
  • 修飾された固定 HTTP のワークロード、35.5% の改善の 77.104 の tok/s;
  • ネイティブエンジンピーク時92.8 tok/s、63.1%の改善;
  • 68.072 ms は最初の生産の内容を仲介しました。

生産エンジンは、フルレジデンシーでのGPU統一メモリの19,102 MiBを占めています。 監視されたウォームエンジンの再起動は4秒で読みやすさを返します。

科学的推論と直接証拠

同一の固定バイリンガルの科学的およびadversarialマニフェストでは、測定精度が63.33%から100%に増加しました。 直接証拠 p50 は 3,556.867 ms から 31.370 ms に落ち、HTTP 限界を超える旧カタログ要求は、236 列の地上ツール トレースで正常に完了します。

知識グラフ, クレームレベルの実証, 証拠評価, ローカルの不確実性および残忍な処理, 接地されたツールと専門家の読み取り専用消費者は、変異を有効にすることなく統合を維持します, 輸出, 摂取または自律的な実験実行.

マイルストーンは、Reinventyâ€TM のコアエッジ理論を実証します。 より有効な推論は、依存性、隠れた権限、またはアンバウンドの実行を妨げる必要はありません。 パフォーマンス、エビデンス、ガバナンスは、NVIDIAがエッジノードを加速させる1つのNVIDIAで一緒に進めることができます。

ソース: Odino 3.11.0/Q19 は生産の記録 Â を管理しました · 確認しました 2026-08-23