AI Video Search

Posez une question en langage naturel — « retrouve la personne en pantalon blanc et pull rouge, près de l'entrée, vers midi » — et l'agent parcourt vos…

Agent custom · VLM + NLP

AI Video Search

Posez une question en langage naturel — « retrouve la personne en pantalon blanc et pull rouge, près de l'entrée, vers midi » — et l'agent parcourt vos enregistrements pour retrouver la personne, l'objet et le moment exacts.

Ce qu'il fait

Vos heures de vidéo, interrogeables en une phrase

Au lieu de visionner des heures d'enregistrement image par image, vous décrivez simplement ce que vous cherchez. L'agent comprend la description — vêtements, couleurs, objets, zone, plage horaire — et remonte les séquences correspondantes, classées par pertinence. La recherche se fait par apparence et par contexte, pas par identification biométrique.

Comment ça marche

Comment ça marche

1

Vous décrivez

Vous formulez votre recherche en langage naturel, comme une phrase normale.

2

L'agent comprend

Il interprète les attributs (couleurs, vêtements, objets), la zone et la plage horaire.

3

Il parcourt vos flux

L'agent balaie les enregistrements et repère les correspondances.

4

Il vous sort la séquence

Résultats classés par pertinence ; vous validez et exportez le clip ou l'instant.

Cas d'usage

Cas d'usage

Sécurité & enquête

Retrouver une personne ou reconstituer un incident à partir d'une simple description.

Objet perdu ou abandonné

Savoir quand et où un objet est apparu ou a disparu d'une zone.

Reconstitution de parcours

Suivre le cheminement d'une personne ou d'une scène sur une plage horaire.

Gain de temps massif

Remplacer des heures de visionnage manuel par une seule requête.

Sous le capot

La stack technique

Recherche vision-langage : les images sont encodées en représentations sémantiques (embeddings) mises en correspondance avec votre requête en langage naturel. Filtrage par attributs d'apparence, par zone et par horodatage. Traitement local sur la box, sur vos caméras existantes — sans identification biométrique par défaut.

Vision-langage (VLM)Embeddings image-texteRecherche sémantiqueAttributs d'apparenceFiltrage spatio-temporelRTSP / ONVIFTraitement local / edgeIndex vectorielSimilarité cosinusGPU CUDAAPI REST / requête NLSans biométrie par défaut
Exemple de code

En pratique

Une requête en langage naturel, exécutée en local sur la box. L'agent encode la requête, la compare aux embeddings de vos flux et renvoie les séquences les plus pertinentes — horodatées et prêtes à exporter.

# Natural-language video search — runs locally on the AI MONITORING box
from aimonitoring import VideoSearch

agent = VideoSearch(source="dvr://site-01", local=True)

results = agent.find(
    query="person in white trousers and a red sweater, near the entrance",
    when="2026-06-12 11:30 → 12:30",
    zones=["entrance", "counter"],
    top_k=5,
)

for r in results:            # ranked by relevance
    print(r.score, r.timestamp, r.camera, r.clip)
# 0.94  11:58:12  cam_02  clip_4f9c.mp4
Bénéfices

Ce que vous y gagnez

  • Des heures de recherche réduites à quelques secondes.
  • Recherche par description — sans connaître l'identité des personnes.
  • Fonctionne sur vos caméras existantes.
  • Traitement local, conforme par défaut.

Cet agent vous intéresse ?

AI Video Search est un exemple d'agent que nous concevons sur demande spéciale. Décrivez votre besoin : on vous montre ce qu'on peut construire pour vous.