Name Last Update
..
README.md Loading commit data...
bench50_v2.py Loading commit data...
bench_ext.py Loading commit data...

README.md

基准(bench)

模型:qwen3.6-27b-iq3:latest,Ollama /v1(地址见脚本头部)。运行一律 uv run --no-project <脚本>。 注意:该 Ollama 服务负载下会间歇 502——dt≈0s 的单条失败先当基础设施抖动、单独重跑核实,再考虑改 prompt。

bench50_v2.py(冻结基线,勿改)

单发话语 → 首步工具选择。50 题。逐字复刻 2026-07-28 生产 prompt(4 类意图门 + 统一 prompt + 6 工具)。 验收存档 bench50_v2_baseline.out:意图门 50/50=100%,agent 严格 38/50=76%、宽松 45/50=90%。

skill-ReAct 落地后:意图门段作废;agent 段对新架构重跑,严格分 ≥76% 才算过闸。

bench_ext.py(扩展轨迹基准)

多步 ReAct 轨迹模拟(喂回固定工具结果直到模型给最终文字,上限 8 步)+ 多轮对话用例:

类别 用例 测什么
消歧 S1-S5 改「审核人」字段=update 不是 examine;撤审=cancelExamine;恢复作废=cancelInvalid
多轮接续 M1/M2/M6 翻页、代词回指、澄清后接续
夹带 M3 回答澄清的同时夹带新查询,两个都要完成
长会话回指 M4 30 轮后回指最早提到的实体
跨轮表单 M5 弹表单隔 2 轮补字段;「大16开」必须逐字保留
提议纪律 M7 提议卡后不重复提议、不声称已执行
uv run --no-project bench_ext.py --arch old          # 现产线复刻(基线)
uv run --no-project bench_ext.py --arch new          # skill-ReAct(从 src/main/resources/prompts/ 读)
uv run --no-project bench_ext.py --arch old --only M5

老架构基线存档:bench_ext_old_baseline.out

流式输出中途点【确认】的并发问题由 Java 单测覆盖(事件日志并发 append 不丢事件),不在本目录。