# 基准(bench) 模型:`qwen3.6-27b-iq3:latest`,Ollama /v1(地址见脚本头部)。运行一律 `uv run --no-project <脚本>`。 注意:该 Ollama 服务负载下会间歇 502——dt≈0s 的单条失败先当基础设施抖动、单独重跑核实,再考虑改 prompt。 ## bench50_v2.py(冻结基线,勿改) 单发话语 → 首步工具选择。50 题。逐字复刻 2026-07-28 生产 prompt(4 类意图门 + 统一 prompt + 6 工具)。 验收存档 `bench50_v2_baseline.out`:意图门 50/50=100%,agent 严格 38/50=76%、宽松 45/50=90%。 skill-ReAct 落地后:意图门段作废;agent 段对新架构重跑,严格分 ≥76% 才算过闸。 ## bench_ext.py(扩展轨迹基准) 多步 ReAct 轨迹模拟(喂回固定工具结果直到模型给最终文字,上限 8 步)+ 多轮对话用例: | 类别 | 用例 | 测什么 | |---|---|---| | 消歧 | S1-S5 | 改「审核人」字段=update 不是 examine;撤审=cancelExamine;恢复作废=cancelInvalid | | 多轮接续 | M1/M2/M6 | 翻页、代词回指、澄清后接续 | | 夹带 | M3 | 回答澄清的同时夹带新查询,两个都要完成 | | 长会话回指 | M4 | 30 轮后回指最早提到的实体 | | 跨轮表单 | M5 | 弹表单隔 2 轮补字段;「大16开」必须逐字保留 | | 提议纪律 | M7 | 提议卡后不重复提议、不声称已执行 | ``` uv run --no-project bench_ext.py --arch old # 现产线复刻(基线) uv run --no-project bench_ext.py --arch new # skill-ReAct(从 src/main/resources/prompts/ 读) uv run --no-project bench_ext.py --arch old --only M5 ``` 老架构基线存档:`bench_ext_old_baseline.out`。 流式输出中途点【确认】的并发问题由 Java 单测覆盖(事件日志并发 append 不丢事件),不在本目录。