umaru~umaru~

系统总览

这是一套受控 Agent 实验与证据展示系统:固定题库、冻结工具数据、同一套代码断言评测,在唯一自变量受控的条件下运行 Agent,并把每一次运行的输入、工具调用、治理判定、输出与评测结论完整落成可审计的公开证据。它不是聊天产品,本站不提供公开试用、发起实验或登录入口。

正式实验状态

正在读取正式发布索引…

正式结果只来自经维护者发布校验(有效样本门槛、逐运行哈希复算、敏感信息扫描)的公开快照;开发调试批次与匿名临时结果不会出现在这里。

一次实验的端到端流程

固定任务上下文构建Agent 规划与工具调用治理检查结果生成评测断言证据发布

每一步的输入、执行模块、关键规则、输出与写入的证据,见执行逻辑;实验如何定义变量与固定条件、指标如何计算,见测试逻辑

系统构成(非实验成绩)

112登记工具(冻结 Mock,只读)
20对比用例(固定题库)
3长上下文 Session 语料(版本化冻结)
7实验模板(每模板一个唯一自变量)

以上是系统的静态构成事实,不代表任何实验结果;实验结果只看实验结果页。

本站怎么读

页面回答什么问题
实验结果做了哪些正式实验,取得了什么结果,成功与失败各是什么样
原始证据每个汇总数字由哪些单次运行支持,单次运行实际发生了什么
执行逻辑一次运行经过哪些模块,每一步的规则与产出的证据是什么
测试逻辑实验怎么设计,指标怎么算,什么算有效运行