De quoi il s'agit
L'edge AI consiste à executer les modèles au plus près de la source des données — sur une machine installée dans l'entreprise — plutôt que d'envoyer les données vers un service distant.
Ce choix était impossible il y a peu : les modèles étaient trop lourds pour du matériel accessible. Il ne l'est plus. Une carte graphique de bureau exécute aujourd'hui en local ce qui exigeait hier un serveur ou un cloud coûteux.
Pour une entreprise marocaine, cela change trois choses à la fois : ses données restent chez elle, son système continue de fonctionner sans internet, et elle echappe aux coûts récurrents qui rendent beaucoup de solutions étrangères inaccessibles.
Ce que nous livrons
- Un dimensionnement matériel adapté à votre charge réelle
- Une box installée sur site, configuree et testee
- Les modèles optimisés pour ce matériel
- Une supervision de l'état du système
- La maintenance et les mises à jour de modèles
Notre approche technique
GPU / CUDADockerPyTorchQuantificationMulti-fluxOn-premiseOffline
Le dimensionnement est le point critique. Un modèle de détection consomme de la mémoire vidéo proportionnellement à la résolution et au nombre de flux traités simultanément. Sous-dimensionner conduit à réduire la cadence, donc à manquer des événements. Sur-dimensionner coûte inutilement cher. Nous mesurons sur vos flux réels avant de proposer une configuration.
L'optimisation des modèles compte autant que le matériel. Réduire la précision numérique d'un modèle — la quantification — divise l'empreinte mémoire et accélère l'inférence, souvent sans perte mesurable sur la tâche visée. C'est ce qui permet de faire tourner plusieurs flux sur une seule machine.
L'architecture est pensee pour l'isolement. Le système doit fonctionner sans internet, indéfiniment. Aucune vérification de licence en ligne, aucune dépendance à un service distant pour l'inférence. Une coupure réseau ne doit pas arrêter la surveillance d'un site.
Ce qui remonte, et ce qui reste. Les vidéos restent locales, intégralement. Les événements, compteurs et alertes — quelques octets — peuvent remonter vers une supervision centrale. Cette séparation est ce qui rend le multi-sites viable : dix sites remontent des indicateurs, pas dix flux vidéo.
Questions fréquentes
Quel matériel faut-il ?
Une machine avec carte graphique, dimensionnée selon votre charge. Nous la specifions au cadrage.
Faut-il une salle serveur ?
Non. Une box compacte dans un local technique ventilé suffit dans la plupart des cas.
Que se passe-t-il si la box tombe en panne ?
Vos caméras et votre enregistrement continuent — nous ne sommes pas dans la chaîne d'enregistrement. Seule l'analyse s'interrompt, et la supervision détecte la panne.
Et pour plusieurs sites ?
Une box par site, une supervision centrale qui agrégé les indicateurs. Les vidéos ne circulent pas entre les sites.
C'est plus cher qu'une solution cloud ?
Il y a un investissement matériel initial, puis pas d'abonnement d'infrastructure. Sur la durée, l'écart se creuse en faveur du local.
Combien de temps ?
4 à 8 semaines, incluant le dimensionnement et l'installation.
What it's about
Edge AI means running the models as close as possible to the data source — on a machine installed in the company — rather than sending the data to a remote service.
This choice was impossible not long ago: models were too heavy for affordable hardware. It no longer is. A desktop graphics card now runs locally what once required a server or a costly cloud.
For a Moroccan company, this changes three things at once: its data stays at home, its system keeps working without internet, and it escapes the recurring costs that make many foreign solutions inaccessible.
What we deliver
- Hardware sizing matched to your real load
- A box installed on site, configured and tested
- Models optimised for that hardware
- Monitoring of the system's health
- Maintenance and model updates
Our technical approach
GPU / CUDADockerPyTorchQuantificationMulti-fluxOn-premiseOffline
Sizing is the critical point. A detection model consumes video memory in proportion to resolution and the number of streams processed at once. Under-sizing means lowering the frame rate, hence missing events. Over-sizing costs needlessly. We measure on your real streams before proposing a configuration.
Model optimisation matters as much as hardware. Reducing a model's numerical precision — quantisation — cuts the memory footprint and speeds up inference, often with no measurable loss on the target task. That's what lets several streams run on a single machine.
The architecture is built for isolation. The system must work without internet, indefinitely. No online licence check, no dependency on a remote service for inference. A network outage must not stop a site's monitoring.
What goes up, and what stays. Videos stay local, entirely. Events, counters and alerts — a few bytes — can go up to a central supervision. This separation is what makes multi-site viable: ten sites report indicators, not ten video streams.
Frequently asked questions
What hardware is needed?
A machine with a graphics card, sized to your load. We specify it at scoping.
Do we need a server room?
No. A compact box in a ventilated technical room is enough in most cases.
What if the box fails?
Your cameras and recording continue — we're not in the recording chain. Only the analysis stops, and monitoring detects the failure.
And for multiple sites?
One box per site, a central supervision aggregating indicators. Videos don't travel between sites.
Is it more expensive than a cloud solution?
There's an initial hardware investment, then no infrastructure subscription. Over time, the gap widens in favour of local.
How long does it take?
4 to 8 weeks, including sizing and installation.