Entreprise · Technique

Notre stack technique

Quatre couches. La performance d'un agent dépend de la plus faible d'entre elles — pas de la plus impressionnante.

Notre stack technique — AI MONITORING

Comment lire cette page

Un agent IA n'est jamais un modèle isolé. C'est un assemblage : une couche qui perçoit, une couche qui comprend, une couche qui agit, et un socle qui fait tourner le tout.

Cette page détaille ce qu'il y a dans chacune. Elle s'adresse à ceux qui veulent savoir ce qu'ils achètent — un DSI, un responsable technique, un dirigeant qui a été déçu par une démonstration.

Couche 1 · Vision

YOLOByteTrackReIDVLMRTSPONVIF

La détection localise personnes, véhicules ou objets dans chaque image. Les modèles de la famille YOLO sont matures et robustes en conditions réelles.

Le suivi relie les détections dans le temps. Sans lui, on ne distingue pas une personne qui reste dix minutes de dix passages successifs. ByteTrack conserve les trajectoires même quand la détection décroche brièvement.

Le filtrage temporel confirme une présence après une durée mesurée en secondes d'horloge, pas en nombre d'images. C'est un détail décisif : la cadence d'un flux RTSP varie avec la charge réseau, et un compteur indexé sur les images dérive dès que le débit baisse.

Les modèles vision-langage (VLM) permettent la recherche en langage naturel dans un flux — décrire ce qu'on cherche plutôt que de programmer une règle.

Les protocoles RTSP et ONVIF sont ce qui permet de se brancher sur une installation existante, quelle qu'en soit la marque.

Couche 2 · Langage et vocal

LLMNLPRAGEmbeddingsOCR / IDPSTT / TTS

Le RAG est le mécanisme central de nos agents métier. Au lieu de demander au modèle ce qu'il sait, on lui fournit les passages pertinents de vos documents et on lui demande de formuler la réponse à partir de ces passages. Chaque réponse cite sa source.

Les embeddings représentent le sens d'un texte indépendamment de sa formulation. C'est ce qui permet de rapprocher une question posée en darija d'un passage rédigé en français, ou de retrouver une information dans un manuel anglais.

L'OCR/IDP lit les documents non structurés — factures, contrats, formulaires, scans, photos. Les modèles actuels identifient les champs par leur sens et non par leur position, ce qui leur permet de traiter un format jamais vu.

Le STT/TTS transforme la parole en texte et inversement, pour les agents vocaux.

Couche 3 · Automatisation

n8nAPI RESTWebhooksMCPRègles métier

L'orchestration fait circuler l'information entre vos systèmes. Elle passe par des workflows versionnés, connectés à vos outils par API quand elle existe, par fichiers sinon.

Deux principes y sont non négociables.

L'idempotence : rejouer une opération ne doit jamais produire un doublon. Sans elle, une coupure réseau crée deux factures ou deux relances.

La file d'attente avec reprise : quand un système est indisponible, l'opération est mise en attente et rejouée. Elle n'est ni perdue ni exécutée à moitié.

Les règles métier explicites traitent ce qui se vérifie — vos seuils, vos tolérances, vos conditions de validation. Le modèle traite ce qui demande de l'interprétation. Un contrôle arithmétique ne se confie pas à un modèle de langage : une addition se vérifie, elle ne s'infère pas.

Couche 4 · Socle et déploiement

GPU / CUDADockerPyTorchQuantificationOn-premiseOffline

Le dimensionnement est le point critique. Un modèle consomme de la mémoire vidéo proportionnellement à la résolution et au nombre de flux traités. Sous-dimensionner conduit à réduire la cadence, donc à manquer des événements. Sur-dimensionner coûte inutilement. Nous mesurons sur vos flux réels avant de proposer une configuration.

La quantification réduit la précision numérique d'un modèle, divisant son empreinte mémoire et accélérant son exécution — souvent sans perte mesurable sur la tâche visée. C'est ce qui permet de faire tourner plusieurs flux sur une seule machine.

La conteneurisation rend chaque déploiement versionné et réversible. On sait quelle version tourne sur quel site, et on peut revenir en arrière.

Le fonctionnement hors ligne est une exigence, pas une option. Pas de vérification de licence en ligne, pas d'inférence distante. Une coupure réseau n'arrête ni la surveillance d'un site ni le traitement d'une ligne de production.

Ce qui relie les quatre couches

Le seuil de confiance. Chaque traitement produit un score. En dessous du seuil que vous fixez, l'agent transmet à un humain plutôt que de décider.

Ce seuil n'est pas un réglage technique, il est économique : il arbitre entre le coût d'une vérification et le coût d'une erreur. C'est vous qui le fixez, au cadrage.

La traçabilité. Chaque réponse rattachée à sa source, chaque action journalisée. Un agent qui agit sans laisser de trace n'est ni auditable ni corrigible — donc pas déployable dans une entreprise sérieuse.

Nos partenaires technologiques

OpenAI et Anthropic pour les modèles de langage.
Verkada pour la vidéosurveillance d'entreprise.
NVIDIA pour le calcul local.
Ultralytics (YOLO) pour la détection.

Nous ne revendons pas leurs licences. Nous construisons avec.

Notre stack.

Quatre couches, un seul socle. Parlons de la vôtre.

Quatre couches. La performance dépend de la plus faible.