系统总览
这是一套受控 Agent 实验与证据展示系统:固定题库、冻结工具数据、同一套代码断言评测,在唯一自变量受控的条件下运行 Agent,并把每一次运行的输入、工具调用、治理判定、输出与评测结论完整落成可审计的公开证据。它不是聊天产品,本站不提供公开试用、发起实验或登录入口。
正式实验状态
正在读取正式发布索引…
正式结果只来自经维护者发布校验(有效样本门槛、逐运行哈希复算、敏感信息扫描)的公开快照;开发调试批次与匿名临时结果不会出现在这里。
一次实验的端到端流程
固定任务→上下文构建→Agent 规划与工具调用→治理检查→结果生成→评测断言→证据发布
系统构成(非实验成绩)
112登记工具(冻结 Mock,只读)
20对比用例(固定题库)
3长上下文 Session 语料(版本化冻结)
7实验模板(每模板一个唯一自变量)
以上是系统的静态构成事实,不代表任何实验结果;实验结果只看实验结果页。
本站怎么读
| 页面 | 回答什么问题 |
|---|---|
| 实验结果 | 做了哪些正式实验,取得了什么结果,成功与失败各是什么样 |
| 原始证据 | 每个汇总数字由哪些单次运行支持,单次运行实际发生了什么 |
| 执行逻辑 | 一次运行经过哪些模块,每一步的规则与产出的证据是什么 |
| 测试逻辑 | 实验怎么设计,指标怎么算,什么算有效运行 |