// 05 · Framework agéntico

¿Qué tan rápido es el pipeline runner?

Overhead de dispatch de herramientas, latencia de recuperación RAG, costo del wrapper de llamada al modelo, distribución del round-trip HITL, step-to-step de orquestación del pipeline. Reproducible desde un clone limpio con pytest benches/, misma convención que el bench del motor.

Motor vs framework

Esta página mide el framework agéntico Python, el runner que orquesta los pasos del pipeline, despacha llamadas a herramientas con alcance, gestiona la recuperación RAG, gate las escrituras por HITL y envuelve las llamadas al modelo. Para el motor de trading Rust in-house (escrituras al state-cache a 310 ns, pipeline completo a 14 µs), ve a latencia del motor.

Qué te da el runner

// gobernanza, no solo velocidad

La latencia que ves abajo prueba que el runner es ligero. Estas son las garantías que hacen que sea seguro correr agentes para clientes reales. Diez se miden en esta página; el resto es cómo está construida la plataforma.

01
Herramientas con alcance y gobernanzaUn crew solo ve las herramientas que tú le concedas. Las no concedidas nunca entran al schema del modelo, así que los permisos son el primitivo de dispatch, no un afterthought.
0.6 µs
02
Escrituras con humano en el bucleCada escritura pasa por el gate de enforcement (un estado reactivo, un cap de escrituras por ciclo, cuota por tenant, cap de costo) y luego espera aprobación del operador. Las lecturas fluyen libremente; las escrituras están gateadas.
0.3 µs
03
RAG por flujo de trabajoCada flujo de trabajo tiene su propio vector store aislado con recuperación híbrida, para que los documentos de un cliente nunca se filtren al contexto de otro.
0.28 ms
04
Trae tu propio modelo20+ proveedores detrás de un único wrapper (Anthropic, OpenAI, Gemini, Mistral, DeepSeek, Qwen, más Ollama y LM Studio locales), con una shape consistente en todos.
1.6 µs
05
Contabilidad de costo y tokensCada llamada al modelo se pricifica contra una tabla por modelo y se acumula en un total USD corriente, para que puedas cobrarles a clientes y capear el gasto por tenant.
0.4 µs
06
Observabilidad completaUn span OpenTelemetry por cada llamada a herramienta, invocación de modelo y ejecución de pipeline, con costo, tokens, latencia y razones de error. Opera agentes que puedes ver de verdad.
0.3 µs
07
Ensamblado estático del contextoEl system prompt, los docs de conocimiento concedidos y los schemas de herramientas se empaquetan en el bloque de contexto que cada turno envía al modelo, separados del historial rolling.
1.4 µs
08
Memoria de crew entre ejecucionesLa memoria de trabajo de un crew persiste entre ejecuciones y se restaura en la siguiente, para que los agentes de larga duración mantengan su contexto entre sesiones.
53 µs
09
Crews agénticosCrews multi-persona (macro, técnico, riesgo, ejecución) pasan el contexto de persona en persona, con un veto de riesgo y sidecars reactivos que pueden detener la cadena a mitad de ejecución.
1.2 µs
10
Defensa contra prompt injectionTodo lo que el agente lee de una fuente no confiable (documentos recuperados, resultados de herramientas, páginas web obtenidas) se escanea en busca de patrones de prompt injection, jailbreak y exfiltración de datos antes de que el modelo pueda actuar. Cada patrón tiene un score de severidad, y el total decide el resultado: el texto seguro pasa; el texto levemente sospechoso igual pasa pero queda cercado como dato al que el modelo no debe obedecer, y el evento se loguea; una señal claramente maliciosa, como un intento de filtrar un secreto o secuestrar el formato de la conversación, se descarta antes de que el modelo la vea siquiera. Qué tan estricto es ese umbral se puede ajustar por deployment.
17 µs
11
Aislamiento de credencialesVaults cifrados por usuario. Los agentes actúan a través de tickets de corta duración y nunca tocan las claves API en crudo, así que los secretos de un cliente permanecen dentro del alcance de ese cliente.
AES-256
12
Multi-tenant por diseñoRoles con alcance de proyecto y aislamiento de estado por pipeline. El crew de un tenant no puede leer, detener ni gastar contra el de otro. Corre muchos clientes en una sola plataforma.
RBAC
Únete a la comunidad
// Cookies
Melaya usa un pequeño set de cookies first-party estrictamente necesarias para autenticarte, mantener tu sesión y proteger la plataforma de abusos. No usamos cookies de publicidad, trackers cross-site ni analytics de terceros por defecto. La lista completa de cookies está en nuestra Política de Privacidad.