// 05 · Framework agentique

À quelle vitesse tourne le pipeline runner ?

Overhead dispatch d'outils, latence RAG retrieval, coût wrapper appel modèle, distribution round-trip HITL, orchestration pipeline step-to-step. Reproductible depuis un clone vierge via pytest benches/, même convention que le bench moteur.

Moteur vs framework

Cette page mesure le framework agentique Python, le runner qui orchestre les steps pipeline, dispatche les appels d'outils scopés, gère le RAG retrieval, gate les writes via HITL et wrappe les appels modèle. Pour le moteur de trading Rust in-house (state-cache writes à 310 ns, pipeline complet à 14 µs), voir latence moteur.

Ce que le runner t'apporte

// gouvernance, pas seulement la vitesse

La latence ci-dessous prouve que le runner est lean. Ce sont les garanties qui rendent safe l'exécution d'agents pour de vrais clients. Dix sont mesurées sur cette page ; le reste, c'est comment la plateforme est construite.

01
Outils scopés et gouvernésUne équipe d'agents IA ne voit que les outils que tu lui accordes. Les outils non accordés n'entrent jamais dans le schéma du modèle - les permissions sont donc la primitive de dispatch, pas une réflexion après coup.
0.6 µs
02
Writes human-in-the-loopChaque write passe par la gate d'enforcement (un watcher réactif d'état, un cap de write par cycle, quota par tenant, cap de coût), puis attend l'approbation de l'opérateur. Les reads circulent librement ; les writes sont gatés.
0.3 µs
03
RAG par workflowChaque workflow dispose de son propre vector store isolé avec hybrid retrieval, pour qu'un document d'un client ne contamine jamais le contexte d'un autre.
0.28 ms
04
Bring-your-own-model20+ fournisseurs derrière un seul wrapper (Anthropic, OpenAI, Gemini, Mistral, DeepSeek, Qwen, plus Ollama et LM Studio en local), une forme cohérente pour tous.
1.6 µs
05
Comptabilité coût et tokensChaque appel modèle est tarifé contre une table par modèle et agrégé dans un total USD courant, pour que tu puisses facturer les clients et limiter les dépenses par tenant.
0.4 µs
06
Observabilité complèteUn span OpenTelemetry par appel d'outil, invocation modèle et run pipeline, portant le coût, les tokens, la latence et les raisons d'erreur. Opère des agents que tu peux vraiment voir.
0.3 µs
07
Assemblage de contexte statiqueLe system prompt, les docs de knowledge accordés et les schémas d'outils sont packés dans le bloc contexte que chaque tour envoie au modèle, séparés de l'historique glissant.
1.4 µs
08
Mémoire d'équipe d'agents IA cross-runLa mémoire de travail d'une équipe d'agents IA persiste entre les runs et se restaure au run suivant, pour que les agents long-running gardent leur contexte entre les sessions.
53 µs
09
Équipes d'agents IA agentiquesLes équipes d'agents IA multi-personas (macro, technique, risque, exécution) se passent le contexte de persona en persona, avec un veto risque et des sidecars réactifs qui peuvent stopper la chaîne en cours de run.
1.2 µs
10
Défense contre l'injection de promptTout ce que l'agent lit depuis une source non fiable (documents récupérés, résultats d'outils, pages web fetchées) est scanné pour détecter des patterns d'injection de prompt, jailbreak et exfiltration de données avant que le modèle puisse agir dessus. Chaque pattern porte un score de sévérité, et le total décide du résultat : le texte safe passe tel quel ; un texte légèrement suspect passe quand même mais est cloisonné comme donnée à laquelle le modèle ne doit pas obéir, et l'événement est loggé ; un signal clairement malveillant, comme une tentative de leak d'un secret ou de hijack du format de conversation, est supprimé avant que le modèle ne le voie. La rigueur de ce seuil est paramétrable par déploiement.
17 µs
11
Isolation des credentialsVaults chiffrés par utilisateur. Les agents agissent via des tickets à courte durée de vie et ne touchent jamais les raw API keys - les secrets d'un client restent scopés à ce client.
AES-256
12
Multi-tenant by designRôles scopés par projet et isolation d'état par pipeline. L'équipe d'agents IA d'un tenant ne peut pas lire, stopper ou dépenser contre un autre. Lance de nombreux clients sur une seule plateforme.
RBAC
Rejoindre la communauté
// Cookies
Melaya utilise un petit jeu de cookies first-party strictement nécessaires pour t'authentifier, maintenir ta session et protéger la plateforme des abus. Pas de cookies publicitaires, ni de trackers cross-site, ni d’analytics niveaus par défaut. La liste complète des cookies est dans notre Politique de confidentialité.