EXPERTISE · TECHNICAL STACK

Intelligence Edge
Nouvelle Génération
& Workflows Agentiques

Architectures hybrides distribuées pour l'analyse de flux massifs, l'intégrité transactionnelle et l'orchestration d'agents IA autonomes en temps réel.

01 — RUNTIME & ORCHESTRATION

Orchestration agentique

LangGraph + supervisors custom orchestrent le raisonnement multi-étapes sur notre flotte LLM auto-hébergée (vLLM + fine-tunes LoRA sur AMD MI50, fallback OpenRouter). Chaque agent tourne en sandbox avec budgets d'outils explicites, audit logs, et isolation par tenant.

LangGraph vLLM LoRA OpenRouter AMD MI50
02 — EDGE COMPUTE

Edge & cloud souverain

Les workloads d'inférence tournent sur l’AWS Wavelength Zone à Casablanca — souverains au sens de l'Article 13 Loi 09-08 / CNDP. NVIDIA Jetson Orin et boîtiers edge AMD pour latence sub-10 ms in-store (corrélation POS, analytics CCTV temps réel).

AWS Wavelength Wavelength Casablanca NVIDIA Jetson Orin Cloudflare Edge
03 — DATA & STREAMS

Traitement de flux temps réel

Ingestion RTSP/ONVIF depuis 11+ marques de caméras → modèles ONNX/TensorRT en edge → bus d'événements → corrélation avec transactions POS. Backbone : Postgres multi-tenant, object storage S3-compatible, Redis pour le hot state.

RTSP / ONVIF ONNX / TensorRT PostgreSQL Redis S3-compatible
04 — APPLICATION LAYER

Application & UI

Rust + Tauri pour les terminaux desktop natifs (offline-first, intégrité transactionnelle HMAC-SHA256). Flutter pour le mobile in-store (cashier handhelds, apps manager). Next.js + Cloudflare Workers pour le back-office et portails clients.

Rust Tauri Flutter Next.js Cloudflare Workers
05 — INFRA & OPS

Infrastructure & opérations

Kubernetes (k3s en edge, EKS en cloud) provisionné via Terraform. CI/CD sur GitHub Actions. Observabilité : Sentry, Prometheus, Loki. Secrets dans HashiCorp Vault. Trail de conformité : audit log style WORM par tenant, exportable pour inspections CNDP / DGI.

Kubernetes (k3s + EKS) Terraform GitHub Actions Sentry · Prometheus · Loki HashiCorp Vault
Retour à l'accueil

Comment nous choisissons une brique technique

Un choix technique se juge sur cinq ans, pas sur une démonstration. Nous retenons quatre critères : la maturité du projet et de sa communauté, le coût réel d'exploitation une fois en production, la réversibilité — pouvons-nous en sortir sans réécrire l'application — et la capacité à l'auto-héberger si la conformité l'exige.

Ce filtre écarte beaucoup d'outils séduisants mais fermés. Il explique aussi pourquoi notre pile privilégie systématiquement les briques ouvertes : ce n'est pas un principe idéologique, c'est une contrainte de souveraineté et de maintenance.

Les couches de notre pile

Modèles et inférence

Nous déployons des modèles à poids ouverts servis par vLLM, en local ou sur infrastructure marocaine. L'enjeu n'est pas la qualité brute du modèle mais le coût par requête à volume réel : quantification, taille de contexte, mise en cache et routage vers le plus petit modèle qui suffit à la tâche.

Orchestration et agents

LangGraph pour les enchaînements qui exigent un état explicite et une reprise après erreur ; n8n pour les automatisations où la lisibilité par une équipe non-développeuse compte davantage. Les deux tournent sur votre infrastructure, ce qui évite qu'un processus métier dépende d'un service tiers.

Edge et embarqué

NVIDIA Jetson et RK3588 pour l'inférence vision à la source. Travailler sous contrainte matérielle impose une discipline utile : on optimise le pipeline avant d'ajouter du calcul, et on mesure la latence de bout en bout plutôt que celle du seul modèle.

Applicatif et interfaces

React et Vite pour le web, Go pour les services à forte concurrence, Rust et Tauri quand il faut un client léger installé sur poste. Le critère est la charge de maintenance à trois ans, pas la nouveauté.

Données et flux

PostgreSQL pour le transactionnel, Redis pour l'état chaud, RTSP et ONVIF pour l'ingestion vidéo. L'interopérabilité par protocoles standards est ce qui nous permet de nous brancher sur du matériel déjà installé plutôt que d'imposer un remplacement.

Ce que nous évitons délibérément

Les plateformes no-code propriétaires pour du métier critique : elles accélèrent le premier mois et rendent captif les années suivantes. Les services qui n'offrent aucune option d'auto-hébergement lorsque des données personnelles sont en jeu. Et les dépendances dont la maintenance repose sur une seule personne, quel que soit leur élégance technique.