2026-08-16 深夜状态 Recap(Hermes 会话 reset 接续用)
场景:用户 reset Hermes 会话。本文件为接续依据——读完即恢复全部上下文。任务仍在后台跑,不受 reset 影响。
当前双线任务(都在跑,完成通知会到)
- OMP 正式评测(research 域,proc_06a72ebd2f89):BENCH-HEAVY-20260815(装修公司业务管理系统 14 实体/15 表),配置已修好:models.yml maxTokens=393216(384K 官方上限)+
--thinking=max,23:37 启动。产出目录 /tmp/omp_bench_heavy(思考阶段,产出 0 正常)。定时跟进 cron:0d9c1c824e13(每 15 分钟,10 次,自动播报状态) - webwatch OMP 可视化 + UI 走查(webwatch 域,proc_e8dc115ffb47):OMP 卡片(实时)+ research「空闲/进行中」不一致修复 + UI 全流程走查 + 最新消息展开/其他折叠(UPDATES.md 已传达)
评测历史(重要——别重复走弯路)
- OMP 第一次评测(bench_task.md HTTP 服务器)作废:任务不对等(8/15 跑的是 BENCH-HEAVY 大型任务,不是 HTTP 服务器)
- 8/15 盲评官方记录(skill: agent-benchmark-blind-review):PI max 67 分/0.040/38min、DSH high 59/0.099——OMP 要对比的是这个
- 失败教训:omp 默认 maxTokens=32K 太小 → thinking=max 思考流截断(stopReason: length)→ 已改 384K
- 计时口径(UPDATES.md 19:10 定案,勿再犯):报告拆两段——环境准备时间(安装/配置,一次性集成成本,不计入任务对比)+ 任务执行时间(任务书读入→交付,与 8/15 的 38-47min 对比的唯一指标)。本次正式跑实测:环境准备 ≈22:46-23:54(68min),任务执行 23:54 起算(run.log Working… 为起点标记)
- thinking 双轴(issue #7380):omp 用
--effort max是强度、--thinking是模式 - 用户裁决:配置不当 ≠ omp 能力——必须调好配置再对比(公平性)
OMP 评测完成后的流程(固定)
- 盲评:产出匿名打包(OMP + 8/15 四路)→ Prime agent 干净 session 当考官(用户指定)→ 8 维 rubric(每维 1-10/总分 80,skill: agent-benchmark-blind-review)→ 分数 vs 67/58/59/57
- 验收判据(用户预期):OMP 分数 > 67 且成本可接受($0.05-0.1 级别)→ 全面交给 OMP;分数接近则讨论
- 用户拍板后执行 omp_handover_checklist.md(bench/ 根目录,5 Phase):
- Phase 4 第一步 = webwatch OMP 可视化(已在做)+ UI 走查 + OMP 实时性优先
- 任务移交 11 个(全部任务书路径在
D:\hermes\hsdesign_work\bench\domains\<域>\running|queue\,执行时以任务书文件为准):- master-app(6):running=
_task_master_apple_bw.md(黑白化);queue=!URGENT-[PI]-20260816-1546-lily_quotation_task.md(Lily 报价 URGENT 第一)→[PI]-20260816-1321-_task_mrmark_senai_quotation.md(Mr Mark)→[PI]-20260816-1540-anne_quotation_task.md(Anne)→[PI]-20260816-1541-master_sidebar_collapse_task.md(侧栏折叠)→[PI]-20260816-1555-perumal_quotation_task.md(Perumal 第二份) - system-ops(2):running=
[PI]-20260816-1538-openclaw_stability_investigation.md(OpenClaw 稳定性根因);queue=[PI]-20260816-1549-watch_pi_stall_fix.md(巡检优化→改 OMP 巡检版) - portal(1):running=
[PI]-20260816-1546-portal_sideside_fix.md(并排打开修复) - whatsapp(1):running=
_task_viewer_apple_bw.md(viewer Apple 黑白化,DSH 类型) - webwatch(2):running=
[PI]-20260816-2350-webwatch_omp_ui.md(OMP 可视化+UI 走查——正在执行);queue=[PI]-20260816-1532-webwatch_lastmsg_fix.md(lastmsg 优化)
- master-app(6):running=
- 默认派发 pi → omp;webwatch 新项目加 omp;记忆体检每周;任务书三段模板
- 其他域任务全部冻结中(等 OMP 切换)
今日已定案(勿重复讨论)
- mini-SWE-agent 排除(无记忆);记忆优先选型;omp 架构已扒清(SDK/RPC 支配、插队 follow_up、记忆 4 backend、profile 隔离)
- 假死真相 = Telegram 网络故障;watchdog v3 验收通过;peak 策略(SGT 14-18 暂停重活)
- 报价任务规范:Lily 逐项和 389,690 差异表、Perumal 10,250 直接采用、Anne 专业 description、编号查 D1 禁猜
凭证/路径速查
- dskey.txt:bench/dskey.txt([REDACTED]);webwatch 生产 8787(SSO 401 正常)
- 交接清单:D:\hermes\hsdesign_work\bench\omp_handover_checklist.md
- 评测报告:bench/domains/research/REPORT_OMP_BENCH.md(旧版 HTTP 横比,需以新评测为准)