Reinventy
Français

Navigation principale

Architecture technologique
Flux visuels et acoustiques convergeant vers un réseau cognitif périphérique

TIN MAN v5.0 · L3 DÉFINITIF · COCKPIT V3 v5.37

Tin Man v5.
L'intelligence, gouvernée en action.

Une architecture cognitive souveraine qui voit, entend, parle, raisonne et peut mener à bien un objectif autorisé sur un seul NVIDIA Jetson AGX Thor. La L3 est définitive. L4 reste humain.

FLOTTE DE 26 CŒURS · AVANTAGE SOUVERAIN · AUTORITÉ HUMAINE VISIBLE

PRODUIT COMMERCIAL · RELEASE CANDIDATE CITADEL

Huit phases du programme achevées. La qualification finale est en cours.

v0.7.0-rc.1RC QUALIFIÉE PAR LOGICIEL
8 / 9PISTES DE PROGRAMME FERMÉES
11,659 / 11,659TÂCHES YOCTO RÉUSSIES
TMOS-8QUALIFICATION MATÉRIELLE ACTIVE

Une architecture commerciale réutilisable pour le vol, la robotique, les systèmes industriels, la mobilité, la marine, l'énergie et les matériaux, sans reconstruire la pile d'intelligence pour chaque machine.

Saisissez Tin Man OS

VÉRITÉ DE LA VERSION · REGISTRE GOUVERNÉ · 12 JUIL. 2026

Tin Man v5.0
L3 définitive.

COCKPIT V3 · LIGNE DE VERSION ACTUELLEv5.37

Navigation vocale, dialogue persistant, description de scène et parole sur les nœuds matériels, à l'intérieur de la même limite de gouvernance visible.

  1. v4.0FabricationPackage opérationnel
  2. v4.5VitalitéPreuve de production
  3. v4.8VéritéEnregistrement rapproché
  4. v5.0DéfinitifPierre de synthèse L3
  5. v5.37Poste de pilotageNavigation sur console vocale
01

Commande jusqu'à la fin

Intention parlée, dialogue, exécution et achèvement régis, sous autorisation humaine explicite.

02

Flotte active à 26 cœurs

Perception, cognition, mémoire, science, voix et gouvernance coordonnées sur un seul nœud périphérique souverain.

03

L’échec rendu visible

La matrice de santé, la reprise après incident, la vivacité et la capacité prévue apparaissent comme un état de fonctionnement et non comme des hypothèses cachées.

04

L4 reste humain

Le système a atteint son niveau L3 définitif. Toute autonomie physique au-delà de cette limite exige une décision distincte et explicite d’autorisation humaine.

COCKPIT V3 · HUD SOVEREIGN EDGE

La machine ne disparaît pas derrière une invite.
Il rend visible son état.

Le cockpit du Tin Man est la surface opérationnelle de l'architecture cognitive : la perception, la voix, le raisonnement, la santé du système et l'autorité humaine partagent un langage visuel en direct.

CAPTURE DU COCKPIT EN DIRECT · 12 JUILLET 2026

Aperçu authentique du Tin Man Cockpit V3 montrant le cortex neural à 26 cœurs, la conscience, le gardien, le dialogue, l'état de la voix et la matrice de santé
Interface authentique · Cortex neural à 26 noyaux · Conscience · Gardien · dialogue · matrice de santé

01 · VÉRITÉ DU SYSTÈME

Un cockpit qui expose ce qui est vivant, ce qui est prévu et ce qui requiert une autorité.

L'aperçu combine l'état de la flotte en direct, la topologie du cortex neural, les observations de conscience, l'application des gardiens, le dialogue, l'état de la voix et la matrice de santé. Au moment de la capture, il a signalé 26 cœurs, 25 sains, zéro dégradé, zéro en panne et un planifié.

  • VISIBLEFlotte, cognition, dialogue et état d’application
  • BOUNDEDLa capacité prévue reste explicitement planifiée
  • HUMANLes actions gouvernées restent soumises à une autorisation humaine explicite

02 · LA VOIX COMME COUCHE OPÉRATIONNELLE

« Hey Tin Man » n'est pas une astuce du navigateur.

La détection de réveil, la reconnaissance vocale, le routage, le raisonnement et la synthèse vocale s'exécutent sur le nœud souverain. Les sessions en anglais et en italien, les dialogues persistants et les flux de description de caméra répondent à la même architecture régie.

WAKEUNDERSTANDREASONSPEAK

Le duplex intégral et l'intervention restent visiblement contrôlés par la porte, et non activés silencieusement.

VOIX · INTERFACE AUTHENTIQUE

Interface vocale Tin Man authentique affichant l'état de réveil, le routage ASR sur l'appareil et les commandes duplex intégral fermées
Phrase d’activation · Routage ASR sur l’appareil · Raisonnement en continu · Duplex soumis à une autorisation humaine explicite
01

Un dialogue qui perdure

Les tours parlés, dactylographiés et assistés par caméra partagent une surface de conversation durable au lieu de disparaître après chaque demande.

02

Une vision qui peut répondre

L'opérateur peut demander ce que voit la caméra ; le noyau multimodal décrit le cadre actuel et identifie le modèle répondant.

03

Une voix sur le nœud

Les réponses sont prononcées via le haut-parleur matériel de Thor, et non déléguées à un navigateur ou à un service vocal externe.

04

La gouvernance dans l'interface

Le cockpit peut lire le plan d'application, mais l'autorité politique reste hors boîte et contrôlée par l'homme.

LE DIFFÉRENCIATEUR

NVFP4 natif sur l’ensemble de la pile multimodale.

La plupart des edge AI quantifient uniquement le modèle de langage et laissent les encodeurs de vision et audio avec une plus grande précision. La fondation NVFP4, éprouvée pour la première fois dans Tin Man v3.0, gère le pipeline complet (vision (ViT), audio (Conformer) et tête de langage) dans natif NVFP4, validé à l'exécution sur un seul appareil de classe Blackwell, en anglais et en italien.

Le résultat : un système sens-penser-parler complet résidant sur un module intégré, avec une marge de mémoire et de débit qui exige généralement le cloud.

PROUVÉ EN DIRECT · ARRÊT DE PRODUCTION · 2026-08-22

Décodage à 98,22 jetons/sec. Même Thor. Même modèle.

TensorRT Edge-LLM 0.9.1 déplace le débit de décodage du lot 1 correspondant de Nemo de 39,01 à 98,22 tok/s, soit 2,52 fois le temps d'exécution précédent. Le préremplissage atteint 9 945,4 tok/s tandis que l'empreinte mémoire du moteur LLM diminue de 1 262 MiB.

  • 98,22 jetons/sDébit de décodage
  • 2.52×Amélioration correspondante
  • 9 945,4 jetons/sDébit de préremplissage
  • −1 262 MioMémoire moteur

NEMO · TENSORRT EDGE-LLM 0.7 → 0.9.1 · QUALIFICATION CORRESPONDANTE

MétriqueDurée d'exécution 0.7Exécution 0.9.1Changement
Latence de pré-remplissage1 250,3284 ms205,9237 ms6,07 fois plus rapide
Débit de préremplissage1 638,0 jetons/s9 945,4 jetons/s6.07×
Latence de décodage25,632 ms/jeton10,181 ms/jeton2,52 fois plus rapide
Débit de décodage39,01 jetons/s98,22 jetons/s2.52×
Mémoire moteur LLM18 569 Mio17 307 Mio−1 262 Mio

Méthode : lot 1, longueur d'entrée 2 048, KV passé 2 048, longueur de sortie 128, trois échauffements et dix itérations avec graphique CUDA sur le même NVIDIA Jetson AGX Thor et le même point de contrôle Nemotron Nano 3 Omni. Le texte, le streaming SSE, la vision, l’audio court et long et la récupération supervisée après incident ont tous franchi la porte de production sans aucune requête Nemo, erreur visuelle ou audio.

FONDATION DE PLATEFORME VALIDÉE ANTÉRIEUREMENT · v3.0

Les gains qui ont établi la pile multimodale actuelle.

La migration V3.0 a d'abord généré des gains de +10 à 25 % par requête. La comparaison V5 répète chaque charge de travail cinq fois sur le runtime de production 0.9.1, exclut l'échauffement et rapporte la médiane : les charges de travail techniques et longues atteignent désormais 90,909-92,191 tok/s.

Charge de travailPrécédent générationV3.0Médiane V5Δ V3 → V5
Salutation courte (IT)19.924.363.025+159.36%
Salutation courte (EN)21.125.857.895+124.40%
Technique moyenne (informatique)23.629.490.909+209.21%
Technique moyenne (EN)25.728.391.065+221.78%
Explication longue (EN)25.230.792.191+200.30%

Les salutations courtes ne produisent que 8 à 15 jetons d'achèvement et entraînent proportionnellement plus de frais généraux. Les exécutions techniques ont généré 159 jetons et l'exécution longue 255 ; une sonde distincte de 511 jetons a soutenu 93,74 tok/s avec une utilisation du GPU de 93 à 97 % (médiane de 96 %).

Voix · latence du premier audio de synthèse streaming (ms)

Charge de travailPrécédent générationV3.0Médiane V5V5 p95Δ V3 → V5
Court (IT)19214699.198103.551−32.06%
Technique moyenne (informatique)176144102.394253.748−28.89%
Court (EN)161155100.770111.951−34.99%

Dix répétitions par charge de travail, échauffement exclu. Le temps s'étend de la requête HTTP aux 2 048 premiers octets de PCM. La médiane V5 améliore la latence du premier audio de 28,89 à 34,99 % ; le cas italien moyen comprend une valeur aberrante de 371,856 ms, reflétée dans son p95.

Perception

Pipeline de détection en direct V5 (caméra + fusion de capteurs LIDAR) — 8,01 ms en moyenne · 24,73 Hz. Par rapport aux chiffres publiés pour la V3.0 (~7 ms, ~20 Hz), la latence des trames est environ 14 % plus élevée tandis que le débit est environ 24 % plus élevé. La comparaison est indicative car le protocole brut V3.0 d'origine n'est pas disponible.

Efficacité et télémétrie

V3.0 mesuré ~58 W sous charge LLM. La sonde de décodage long V5 soutenue 93,74 jetons/s plus de 511 jetons avec une utilisation du GPU de 93 à 97 % (médiane de 96 %). Aucun échantillon de puissance V5 comparable n’a été capturé dans cette analyse.

CAPABILITIES

Du modèle multimodal au système d’exploitation gouverné.

  • 01

    Un modèle, trois modalités

    Texte, image et audio dans un seul modèle NVFP4 sur appareil.

  • 02

    Dialogue persistant et navigation vocale

    Discours sur boîte, transcriptions durables et navigation EN/IT sur la surface de fonctionnement du Cockpit V3.

  • 03

    Une vision qui répond

    Perception par caméra et LIDAR ainsi que description en langage naturel de la scène visuelle actuelle.

  • 04

    Exécution régie

    L’intention ne peut passer du dialogue à l’aboutissement que grâce à une politique signée, des portes visibles et une autorité humaine explicite.

  • 05

    Copilote scientifique Alchemi

    Objectifs matériaux, campagnes gouvernées, traçabilité des preuves et jalons de progression soumis à une autorisation humaine.

  • 06

    État de production résistant aux chocs

    Démarrage séquencé, matrice de santé, preuves de récupération et état de fonctionnement en cas de panne.

  • 07

    Flotte cognitive à 26 cœurs

    Perception, langage, raisonnement, mémoire, science, opérations et gouvernance sur un seul nœud périphérique.

ARCHITECTURE COGNITIVE

26 cœurs actifs. Une flotte cognitive gouvernée.

Tin Man v5 coordonne une flotte active de 26 cœurs sur un seul Jetson AGX Thor. La carte des capacités publiques ci-dessous regroupe les domaines cognitifs divulgués ; la capture du Cockpit V3 a signalé 25 cœurs sains, zéro dégradé, zéro en panne et un cœur prévu le 12 juillet 2026.

  • Perception et détection

    • vision — fusion caméra-capteur LIDAR
    • rétine – perception visuelle (prévue)
    • tronc cérébral — Pont de capteurs LIDAR
    • lidar_driver — Pilote de capteur LIDAR
  • Langue et voix

    • nemo — porte d'entrée LLM multimodale (NVFP4)
    • chat – porte d'entrée conversationnelle
    • riva — reconnaissance vocale + synthèse en 7 langues
    • voice_agent — agent vocal dans la chambre
  • Raisonnement et mémoire

    • préfrontal - routeur de décision + intention
    • conscience - raisonnement sur l'appareil LLM (Odino)
    • mémoire — mémoire épisodique + récupération
  • Action, sécurité et gouvernance

    • temps réel — planificateur en temps réel
    • mouvement - planification du chemin (planifié)
    • tuteur — application de la sécurité et de la conformité
    • conscience_observer — observateur d'audit méta-cognitif
  • Sciences et matériaux

    • science — simulation des matériaux
    • alchemi_workbench — atelier de matériaux
    • alchemi_em — simulation de matériaux électromagnétiques
  • Plateforme et orchestration

    • passerelle – passerelle stratégique
    • poste de pilotage — console de commande
    • agent — rédaction d'usine de contenu

Projection publique par domaine cognitif. La liste actuelle des cockpits est26 cœurs actifs; les détails d'implémentation restreints restent en dehors de cette surface L0.

ARCHITECTURE

Tin Man est le fonctionnement de Shield Brain.

Tin Man v5 implémente l'architecture de contrôle IA déterministe Shield Brain sur NVIDIA Jetson AGX Thor. Sa flotte de 26 cœurs est séquencée, visible et séparée en domaines opérationnels délimités, tandis que l'exécution gouvernée reste subordonnée à la politique signée et à l'autorité humaine.

Shield Brain est l'architecture de contrôle déterministe de l'IA protégée par une demande de brevet déposée au Canada (2025, en attente). Il définit le modèle d'exécution isolé du matériel qui garantit un déterminisme critique en matière de sécurité sous des charges de travail génératives variables – et Tin Man est l'endroit où cette architecture devient opérationnelle.

Voir l'architecture Shield Brain →

CONTRIBUTION TECHNIQUE

Un patch de câblage à 13 lignes a falsifié une limitation du domaine public.

Le NVFP4 natif sur les encodeurs vision et audio n’était pas gratuit. Une inférence du domaine public a conclu que TensorRT ne pouvait pas analyser la déquantification NVFP4 pour les architectures d'encodeur (ViT, Conformer), exigeant le repli BF16. Nous avons empiriquement falsifié cela. La limitation apparente était un petit écart de câblage dans un réécrivain post-export – présent dans le chemin d’exportation LLM mais pas dans le chemin de l’encodeur. Une fois câblé, l'encodeur ONNX analyse proprement et les moteurs sont construits nativement dans NVFP4.

Ce correctif est devenu la base de quantification mesurée intégrée dans Tin Man v5 sur JetPack 7.2. Le modèle de réparation, communément appelé patch de câblage à 13 lignes, s'applique comme 12 insertions sur 6 fichiers dans la couche de réécriture TRT-Edge-LLM et est réutilisable pour toute architecture d'encodeur quantifié NVFP4.

Nous avons documenté les résultats et préparé un ensemble de six correctifs atomiques pour une contribution en amont à NVIDIA TRT-Edge-LLM.

  • 13 COL

    populairement cité (12 insertions dans 6 fichiers, précis)

  • +331 / −63 LOC

    ensemble total de correctifs atomiques pour l'amont

  • 6 patchs · 3 tours

    Câblage d'exportation du codeur NVFP4 · préparé pour l'amont

PLATFORM

NVIDIA Jetson AGX Thor — Blackwell intégré.

  • NVIDIA JetPack 7.2
  • TensorRT 10.16.2
  • CUDA13.2
  • Blackwell (sm_110a)
  • Mémoire unifiée de 128 Go
  • GPUNVIDIA Blackwell intégré (sm_110a) · 80 cœurs Tensor Gen 5 · 2 560 cœurs CUDA
  • CPU14× Arm Neoverse V3AE + cluster d'efficacité
  • Mémoire unifiée128 Go LPDDR5x · ~273 Go/s de bande passante
  • StockageNVMe PCIe 5.0 · Lecture séquentielle ~ 14 Go/s
  • Pile logicielleJetPack 7.2 · CUDA 13.2 · TensorRT 10.16.2 · Runtime NVFP4 natif
  • DéploiementConteneurisé · souverain par défaut · la sortie contrôlée reste soumise à des règles

EXÉCUTION RÉGIE · L3 DÉFINITIVE

Les capacités progressent. L’autorité ne dérive pas.

Tin Man v5 peut conduire un objectif autorisé depuis l’intention exprimée oralement jusqu’à son accomplissement, en passant par le raisonnement et l’utilisation d’outils, tout en respectant les politiques signées, les limites de sécurité physique et les validations humaines explicites. L’autonomie physique L4 ne découle pas des capacités L3 : elle exige une décision distincte et explicite d’autorisation humaine.

ECOSYSTEM

Membre NVIDIA Inception. Prêt à contribuer en amont.

Reinventy est membre du programme NVIDIA Inception. Tin Man v5 reprend la pile multimodale complète NVFP4 validée pour la première fois lors de l'exécution dans la v3, y compris les chemins d'encodeur que la recette de référence officielle NVIDIA n'a ​​pas quantifiée de manière native au moment de la mesure.

Le correctif de câblage d'exportation de l'encodeur NVFP4 documenté ci-dessus est réutilisable au-delà du propre déploiement de Reinventy, et nous avons préparé un ensemble de six correctifs prêts à être examinés par la communauté.

ENGAGE

Les mémoires de capacités sont publiés dans le cadre d’un partenariat.

Le rapport sur l'état définitif de la v5, le résumé des capacités de Cockpit V3, la base de performances mesurées de la v3, le contexte des correctifs en amont et les feuilles de route d'intégration sont publiés dans le cadre d'un accord de non-divulgation. Contactez-nous et nous acheminerons la conversation vers le responsable technique.

Directement : engage@reinventy-solutions.ca