De quoi il s'agit
L'edge AI consiste a executer les modeles au plus pres de la source des donnees — sur une machine installee dans l'entreprise — plutot que d'envoyer les donnees vers un service distant.
Ce choix etait impossible il y a peu : les modeles etaient trop lourds pour du materiel accessible. Il ne l'est plus. Une carte graphique de bureau execute aujourd'hui en local ce qui exigeait hier un serveur ou un cloud couteux.
Pour une entreprise marocaine, cela change trois choses a la fois : ses donnees restent chez elle, son systeme continue de fonctionner sans internet, et elle echappe aux couts recurrents qui rendent beaucoup de solutions etrangeres inaccessibles.
Ce que nous livrons
- Un dimensionnement materiel adapte a votre charge reelle
- Une box installee sur site, configuree et testee
- Les modeles optimises pour ce materiel
- Une supervision de l'etat du systeme
- La maintenance et les mises a jour de modeles
Notre approche technique
GPU / CUDADockerPyTorchQuantificationMulti-fluxOn-premiseOffline
Le dimensionnement est le point critique. Un modele de detection consomme de la memoire video proportionnellement a la resolution et au nombre de flux traites simultanement. Sous-dimensionner conduit a reduire la cadence, donc a manquer des evenements. Sur-dimensionner coute inutilement cher. Nous mesurons sur vos flux reels avant de proposer une configuration.
L'optimisation des modeles compte autant que le materiel. Reduire la precision numerique d'un modele — la quantification — divise l'empreinte memoire et accelere l'inference, souvent sans perte mesurable sur la tache visee. C'est ce qui permet de faire tourner plusieurs flux sur une seule machine.
L'architecture est pensee pour l'isolement. Le systeme doit fonctionner sans internet, indefiniment. Aucune verification de licence en ligne, aucune dependance a un service distant pour l'inference. Une coupure reseau ne doit pas arreter la surveillance d'un site.
Ce qui remonte, et ce qui reste. Les videos restent locales, integralement. Les evenements, compteurs et alertes — quelques octets — peuvent remonter vers une supervision centrale. Cette separation est ce qui rend le multi-sites viable : dix sites remontent des indicateurs, pas dix flux video.
Questions frequentes
Quel materiel faut-il ?
Une machine avec carte graphique, dimensionnee selon votre charge. Nous la specifions au cadrage.
Faut-il une salle serveur ?
Non. Une box compacte dans un local technique ventile suffit dans la plupart des cas.
Que se passe-t-il si la box tombe en panne ?
Vos cameras et votre enregistrement continuent — nous ne sommes pas dans la chaine d'enregistrement. Seule l'analyse s'interrompt, et la supervision detecte la panne.
Et pour plusieurs sites ?
Une box par site, une supervision centrale qui agrege les indicateurs. Les videos ne circulent pas entre les sites.
C'est plus cher qu'une solution cloud ?
Il y a un investissement materiel initial, puis pas d'abonnement d'infrastructure. Sur la duree, l'ecart se creuse en faveur du local.
Combien de temps ?
4 a 8 semaines, incluant le dimensionnement et l'installation.
What it's about
Edge AI means running the models as close as possible to the data source — on a machine installed in the company — rather than sending the data to a remote service.
This choice was impossible not long ago: models were too heavy for affordable hardware. It no longer is. A desktop graphics card now runs locally what once required a server or a costly cloud.
For a Moroccan company, this changes three things at once: its data stays at home, its system keeps working without internet, and it escapes the recurring costs that make many foreign solutions inaccessible.
What we deliver
- Hardware sizing matched to your real load
- A box installed on site, configured and tested
- Models optimised for that hardware
- Monitoring of the system's health
- Maintenance and model updates
Our technical approach
GPU / CUDADockerPyTorchQuantificationMulti-fluxOn-premiseOffline
Sizing is the critical point. A detection model consumes video memory in proportion to resolution and the number of streams processed at once. Under-sizing means lowering the frame rate, hence missing events. Over-sizing costs needlessly. We measure on your real streams before proposing a configuration.
Model optimisation matters as much as hardware. Reducing a model's numerical precision — quantisation — cuts the memory footprint and speeds up inference, often with no measurable loss on the target task. That's what lets several streams run on a single machine.
The architecture is built for isolation. The system must work without internet, indefinitely. No online licence check, no dependency on a remote service for inference. A network outage must not stop a site's monitoring.
What goes up, and what stays. Videos stay local, entirely. Events, counters and alerts — a few bytes — can go up to a central supervision. This separation is what makes multi-site viable: ten sites report indicators, not ten video streams.
Frequently asked questions
What hardware is needed?
A machine with a graphics card, sized to your load. We specify it at scoping.
Do we need a server room?
No. A compact box in a ventilated technical room is enough in most cases.
What if the box fails?
Your cameras and recording continue — we're not in the recording chain. Only the analysis stops, and monitoring detects the failure.
And for multiple sites?
One box per site, a central supervision aggregating indicators. Videos don't travel between sites.
Is it more expensive than a cloud solution?
There's an initial hardware investment, then no infrastructure subscription. Over time, the gap widens in favour of local.
How long does it take?
4 to 8 weeks, including sizing and installation.