Computer Vision & détection

AM-VISION-01 · vision.perimeter

La discipline qui transforme un flux d'images en observations exploitables. C'est le socle de tous nos agents de vision.

Code  AM-VISION-01Module  vision.perimeterExécution  Edge / sur site
/agents-ia/computer-vision-detection — AI MONITORING

De quoi il s'agit

La détection d'objets consiste à localiser et identifier ce qui apparaît dans une image — personnes, véhicules, objets. C'est un problème largement résolu : les modèles de la famille YOLO sont matures, rapides et robustes en conditions réelles.

C'est aussi la partie la plus visible et la moins déterminante d'un système. Détecter une personne est facile. Décider si cette détection mérite une alerte à 3 h du matin dans cette zone-là ne l'est pas — et cela ne se résout pas avec un modèle plus gros.

Les quatre étages de la chaîne

La détection localise les objets dans chaque image, avec un score de confiance.

Le suivi relie les détections entre elles dans le temps. ByteTrack conserve les trajectoires y compris quand la détection décroche sur quelques images.

Le filtrage temporel confirme un événement après une durée mesurée en secondes d'horloge. C'est l'étage que la plupart des solutions négligent, et celui qui décide de la crédibilité du système.

La logique spatiale transforme une détection en événement qui a du sens : zones d'intérêt, lignes de comptage directionnelles, périmètres, plages horaires.

Ce qui limite réellement les performances

Pas la résolution — l'angle de vue. Une caméra pointée à la verticale depuis un plafond ne permettra pas un comptage directionnel fiable, quelle que soit sa qualité.

Et la lumière. Les modèles sont robustes en faible luminosité, mais une scène quasi noire ne produit rien d'exploitable. Aucun modèle n'invente l'information absente.

Sur l'identité

La classification se fait par comportement et par zone. Le ReID permet de reconnaître qu'il s'agit de la même silhouette dans un même champ, sans constituer d'identité biométrique. C'est une différence de nature, pas de degré.


YOLOByteTrackReIDNMSIoUQuantificationCUDAVLM
ARCHITECTURE
Frame → prétraitement (resize · normalisation)
      → backbone convolutif → tête de détection
      → NMS (suppression des doublons, seuil IoU)
      → boîtes + classes + scores
              ↓
      association temporelle (ByteTrack)
      ├─ appariement haute confiance (IoU + prédiction)
      └─ seconde passe sur détections faibles → récupération
              ↓
      trajectoires persistantes (ID intra-champ)

Sous le capot

La détection. Un modèle de la famille YOLO produit, pour chaque image, un ensemble de boîtes englobantes avec une classe et un score. La NMS élimine ensuite les détections redondantes qui se recouvrent au-delà d'un seuil d'IoU.

Deux réglages comptent : le seuil de confiance, qui arbitre entre détections manquées et fausses détections, et le seuil d'IoU de la NMS, qui décide de la fusion de boîtes voisines. Sur une scène dense, un seuil trop agressif fusionne deux personnes proches en une seule.

Le suivi. L'apport principal de ByteTrack est sa seconde passe sur les détections de faible score. Un tracker classique les ignore ; ByteTrack tente de les apparier aux trajectoires existantes. C'est ce qui maintient l'identité pendant une occlusion partielle, là où d'autres algorithmes perdent la piste et recréent un nouvel identifiant.

Le ReID compare des signatures d'apparence pour retrouver une trajectoire interrompue dans un même champ de caméra. Il ne constitue aucune identité biométrique et n'est pas utilisé entre caméras.

La quantification réduit la précision numérique du modèle — typiquement de FP32 vers INT8 ou FP16. L'empreinte mémoire est divisée et l'inférence accélérée, sans perte mesurable sur la tâche de détection. C'est ce qui permet de traiter plusieurs flux sur un GPU unique en déploiement local.

Les VLM ouvrent une capacité différente : décrire une scène en langage naturel plutôt que de programmer une règle. Ils sont plus lourds et s'utilisent en complément, sur des requêtes ponctuelles, pas en traitement continu.

Parlons de votre projet.

Trente minutes, gratuit et sans engagement.


Sous le capot — l'ingénierie de la vision

Une démonstration de vision par ordinateur se monte en une journée : un modèle pré-entraîné, une vidéo d'exemple, des rectangles autour des personnes. Un système exploitable demande de traiter tout ce que la démonstration évite — la lumière qui change, les reflets, les occlusions, la caméra mal orientée, le flux qui saute des images, la personne immobile pendant vingt minutes. Notre travail porte sur cet écart.

Perception & suivi

YOLOByteTrackReIDVLMRTSPONVIFCUDAEdge

La chaîne comporte quatre étages, et chacun résout un problème que le précédent ne peut pas résoudre. La détection localise personnes, véhicules ou objets dans chaque image : c'est l'étage le plus visible et le moins déterminant, les modèles de la famille YOLO étant matures en conditions réelles.

Le suivi relie les détections dans le temps. Sans lui, on ne distingue pas une personne qui reste dix minutes d'un flux de dix passages. ByteTrack conserve les trajectoires même quand la détection décroche brièvement — derrière un présentoir, dans un contre-jour.

Le filtrage temporel est l'étage que la plupart des solutions négligent, et celui qui décide de la crédibilité du système. Une présence n'est confirmée qu'après une durée mesurée en secondes réelles : la cadence d'un flux RTSP varie selon la charge réseau, et un compteur indexé sur le nombre d'images dérive dès que le débit baisse. Le notre est indexé sur l'horloge.

La logique spatiale transforme une détection en événement qui a du sens : zones d'intérêt, lignes de comptage directionnelles, périmètres interdits, plages horaires — définis site par site. Sur l'identité : la classification se fait par comportement et par zone, pas par identification des personnes. Le ReID reconnaît la même silhouette dans un même champ sans constituer d'identité biométrique. La reconnaissance faciale n'est activée que dans un cadre légal strict, sur autorisation préalable de la CNDP.

Exploiter l'installation existante

RTSPONVIFEdgeGPUMulti-fluxRétention locale

L'architecture de référence est simple : caméras -> DVR/NVR -> box AI MONITORING -> IA locale -> tableau de bord et alertes. Le flux est lu, pas detourne ; votre enregistrement continue normalement. Le raccordement se fait en RJ45 filaire, jamais en Wi-Fi : un flux vidéo continu sur un réseau sans fil décroche, et un décrochage produit des trous dans le comptage ou des alertes manquées.

Ce qui reste local : les vidéos, intégralement. Ce qui peut remonter : les événements, les compteurs, les alertes — quelques octets par événement, pas des flux. Cette séparation est ce qui rend le système utilisable en multi-sites sans coût de bande passante, et ce qui simplifie la conformité à la loi 09-08.

Questions fréquentes

Faut-il changer nos caméras ?
Dans la grande majorité des cas, non. Si vos caméras exposent un flux RTSP ou ONVIF — ce qui est le cas de la quasi-totalite des installations IP — elles conviennent. Nous le vérifions au diagnostic.
Faut-il remplacer notre installation (DVR, câblage) ?
Non. Le DVR reste en place, nous lisons le flux sans interférer avec l'enregistrement. Les caméras et le câblage restent également.
Les vidéos partent-elles dans le cloud ?
Non. Le traitement se fait sur une machine installée chez vous. Aucun flux complet n'est diffuse en permanence vers l'extérieur.
Que se passe-t-il si internet tombe ?
Le système continue de fonctionner : le traitement est local. Seule la remontée des alertes vers l'extérieur est interrompue, et reprend au rétablissement.
Combien de caméras peut traiter une seule machine ?
Cela dépend de la résolution, de la cadence et des traitements activés. Nous dimensionnons au cadrage, sur votre installation réelle — annoncer un nombre sans avoir vu les flux n'aurait aucun sens.
Peut-on commencer par une seule caméra ?
Oui, et c'est même ce que nous recommandons. On valide sur un point, on mesure, puis on étend.
Faites-vous de la reconnaissance faciale ?
Pas par défaut, et jamais sans cadre légal. C'est une capacité activée uniquement pour des clients disposant d'une autorisation CNDP préalable.
Est-ce conforme à la réglementation marocaine ?
Le traitement local et l'absence de biométrie par défaut simplifient considérablement la conformité à la loi 09-08. Nous documentons le traitement mis en place.
Combien de temps pour la mise en production ?
4 à 8 semaines entre le cadrage et la mise en production. Le nombre de caméras et la complexité des zones à définir sont les facteurs déterminants — l'installation physique est courte, c'est le réglage qui fait la qualité.