Computer Vision & détection
La discipline qui transforme un flux d'images en observations exploitables. C'est le socle de tous nos agents de vision.

De quoi il s'agit
La détection d'objets consiste à localiser et identifier ce qui apparaît dans une image — personnes, véhicules, objets. C'est un problème largement résolu : les modèles de la famille YOLO sont matures, rapides et robustes en conditions réelles.
C'est aussi la partie la plus visible et la moins déterminante d'un système. Détecter une personne est facile. Décider si cette détection mérite une alerte à 3 h du matin dans cette zone-là ne l'est pas — et cela ne se résout pas avec un modèle plus gros.
Les quatre étages de la chaîne
La détection localise les objets dans chaque image, avec un score de confiance.
Le suivi relie les détections entre elles dans le temps. ByteTrack conserve les trajectoires y compris quand la détection décroche sur quelques images.
Le filtrage temporel confirme un événement après une durée mesurée en secondes d'horloge. C'est l'étage que la plupart des solutions négligent, et celui qui décide de la crédibilité du système.
La logique spatiale transforme une détection en événement qui a du sens : zones d'intérêt, lignes de comptage directionnelles, périmètres, plages horaires.
Ce qui limite réellement les performances
Pas la résolution — l'angle de vue. Une caméra pointée à la verticale depuis un plafond ne permettra pas un comptage directionnel fiable, quelle que soit sa qualité.
Et la lumière. Les modèles sont robustes en faible luminosité, mais une scène quasi noire ne produit rien d'exploitable. Aucun modèle n'invente l'information absente.
Sur l'identité
La classification se fait par comportement et par zone. Le ReID permet de reconnaître qu'il s'agit de la même silhouette dans un même champ, sans constituer d'identité biométrique. C'est une différence de nature, pas de degré.
Frame → prétraitement (resize · normalisation)
→ backbone convolutif → tête de détection
→ NMS (suppression des doublons, seuil IoU)
→ boîtes + classes + scores
↓
association temporelle (ByteTrack)
├─ appariement haute confiance (IoU + prédiction)
└─ seconde passe sur détections faibles → récupération
↓
trajectoires persistantes (ID intra-champ)Sous le capot
La détection. Un modèle de la famille YOLO produit, pour chaque image, un ensemble de boîtes englobantes avec une classe et un score. La NMS élimine ensuite les détections redondantes qui se recouvrent au-delà d'un seuil d'IoU.
Deux réglages comptent : le seuil de confiance, qui arbitre entre détections manquées et fausses détections, et le seuil d'IoU de la NMS, qui décide de la fusion de boîtes voisines. Sur une scène dense, un seuil trop agressif fusionne deux personnes proches en une seule.
Le suivi. L'apport principal de ByteTrack est sa seconde passe sur les détections de faible score. Un tracker classique les ignore ; ByteTrack tente de les apparier aux trajectoires existantes. C'est ce qui maintient l'identité pendant une occlusion partielle, là où d'autres algorithmes perdent la piste et recréent un nouvel identifiant.
Le ReID compare des signatures d'apparence pour retrouver une trajectoire interrompue dans un même champ de caméra. Il ne constitue aucune identité biométrique et n'est pas utilisé entre caméras.
La quantification réduit la précision numérique du modèle — typiquement de FP32 vers INT8 ou FP16. L'empreinte mémoire est divisée et l'inférence accélérée, sans perte mesurable sur la tâche de détection. C'est ce qui permet de traiter plusieurs flux sur un GPU unique en déploiement local.
Les VLM ouvrent une capacité différente : décrire une scène en langage naturel plutôt que de programmer une règle. Ils sont plus lourds et s'utilisent en complément, sur des requêtes ponctuelles, pas en traitement continu.
Parlons de votre projet.
Trente minutes, gratuit et sans engagement.
Sous le capot — l'ingénierie de la vision
Une démonstration de vision par ordinateur se monte en une journée : un modèle pré-entraîné, une vidéo d'exemple, des rectangles autour des personnes. Un système exploitable demande de traiter tout ce que la démonstration évite — la lumière qui change, les reflets, les occlusions, la caméra mal orientée, le flux qui saute des images, la personne immobile pendant vingt minutes. Notre travail porte sur cet écart.
Perception & suivi
La chaîne comporte quatre étages, et chacun résout un problème que le précédent ne peut pas résoudre. La détection localise personnes, véhicules ou objets dans chaque image : c'est l'étage le plus visible et le moins déterminant, les modèles de la famille YOLO étant matures en conditions réelles.
Le suivi relie les détections dans le temps. Sans lui, on ne distingue pas une personne qui reste dix minutes d'un flux de dix passages. ByteTrack conserve les trajectoires même quand la détection décroche brièvement — derrière un présentoir, dans un contre-jour.
Le filtrage temporel est l'étage que la plupart des solutions négligent, et celui qui décide de la crédibilité du système. Une présence n'est confirmée qu'après une durée mesurée en secondes réelles : la cadence d'un flux RTSP varie selon la charge réseau, et un compteur indexé sur le nombre d'images dérive dès que le débit baisse. Le notre est indexé sur l'horloge.
La logique spatiale transforme une détection en événement qui a du sens : zones d'intérêt, lignes de comptage directionnelles, périmètres interdits, plages horaires — définis site par site. Sur l'identité : la classification se fait par comportement et par zone, pas par identification des personnes. Le ReID reconnaît la même silhouette dans un même champ sans constituer d'identité biométrique. La reconnaissance faciale n'est activée que dans un cadre légal strict, sur autorisation préalable de la CNDP.
Exploiter l'installation existante
L'architecture de référence est simple : caméras -> DVR/NVR -> box AI MONITORING -> IA locale -> tableau de bord et alertes. Le flux est lu, pas detourne ; votre enregistrement continue normalement. Le raccordement se fait en RJ45 filaire, jamais en Wi-Fi : un flux vidéo continu sur un réseau sans fil décroche, et un décrochage produit des trous dans le comptage ou des alertes manquées.
Ce qui reste local : les vidéos, intégralement. Ce qui peut remonter : les événements, les compteurs, les alertes — quelques octets par événement, pas des flux. Cette séparation est ce qui rend le système utilisable en multi-sites sans coût de bande passante, et ce qui simplifie la conformité à la loi 09-08.