// 05 · 智能体框架

流水线运行器有多快

工具调度开销、RAG 检索延迟、模型调用封装成本、HITL 往返分布、流水线编排步骤间耗时。可从全新克隆通过 pytest benches/ 复现,与引擎测试约定相同。

引擎与框架

本页测量的是 Python 智能体框架,即编排流水线步骤、调度有作用域的工具调用、管理 RAG 检索、通过 HITL 门控写入操作并封装模型调用的运行器。关于自研 Rust 交易引擎(状态缓存写入 310 ns,完整流水线 14 µs),请参阅 引擎延迟

运行器提供的功能

// 治理,不只是速度

下方的延迟数据证明运行器足够精简。以下是使其可安全为真实客户运行智能体的保障。本页测量其中十项;其余是平台的构建方式。

01
有作用域的受管工具团队只能看到你授权给它的工具。未授权的工具不会进入模型的结构定义,因此权限是调度原语,而非事后补救。
0.6 µs
02
人在回路的写入控制每次写入都经过执法门控(响应式监视器状态、每周期写入上限、每租户配额、费用上限),然后等待操作员审批。读取自由流通;写入受门控。
0.3 µs
03
每工作流独立 RAG每个工作流有独立的向量存储和混合检索,一个客户的文档永远不会渗入另一个客户的上下文。
0.28 ms
04
自带模型20+ 个提供商统一封装(Anthropic、OpenAI、Gemini、Mistral、DeepSeek、Qwen,以及本地 Ollama 和 LM Studio),跨所有提供商接口一致。
1.6 µs
05
费用与 token 计量每次模型调用都根据每模型价格表计价,并汇总为累计 USD 总额,方便向客户计费并按租户设置消费上限。
0.4 µs
06
全面可观测性每次工具调用、模型调用和流水线运行各有一个 OpenTelemetry span,携带费用、token、延迟和错误原因。运行你真正看得见的智能体。
0.3 µs
07
静态上下文组装系统提示、授权知识文档和工具结构定义在每轮发送给模型时打包进上下文块,与滚动历史记录分离存放。
1.4 µs
08
跨运行团队记忆团队的工作记忆在运行之间持久化,并在下次运行时恢复,使长期运行的智能体能够跨会话保持上下文。
53 µs
09
多智能体团队多角色团队(宏观、技术、风险、执行)在角色间传递上下文,配备风险否决机制和响应式旁路智能体,可在运行中途中止链式调用。
1.2 µs
10
提示注入防御智能体从不受信任来源(检索文档、工具结果、抓取的网页)读取的任何内容,在模型处理之前都会扫描提示注入、越狱和数据外泄模式。每种模式携带严重性评分,总分决定结果:安全文本直接通过;轻度可疑文本仍然传递但被隔离为模型不得遵从的数据,同时记录事件;明确恶意信号(如尝试泄露密钥或劫持对话格式)在模型看到之前即被丢弃。该截断阈值可按部署调整。
17 µs
11
凭证隔离每用户加密保险库。智能体通过短效票据操作,从不接触原始 API 密钥,客户的密钥始终仅限于该客户的作用域。
AES-256
12
多租户设计项目级角色与每流水线状态隔离。一个租户的团队不能读取、中止或消耗另一个租户的资源。在一个平台上运行多个客户。
RBAC
加入社区
// Cookie
Melaya 使用一小组第一方 cookie,仅用于身份验证、维持会话和保护平台。默认不使用广告 cookie、跨站追踪器或第三方分析。完整 cookie 清单见我们的 隐私政策.