状态
–
当前轮次–
总进度–
消耗 tokens–
费用–
当前规模–
当前模型–
推理深度–
月–
种子–
老人人数–
焦点数–
干预月–
–
0 位 · 徽标为 LLM 焦点 · 数据实时读取
平稳
偏高
高孤独
LLM 焦点(方框)
纯示意图:房屋与走动位置为随机可视化效果,不代表真实地理坐标或研究参数。点击圆点查看该老人详情。
全部决策记录(焦点老人 + 规则层干预),最新在前。
正式批次论文核心结果
只纳入通过 0–24 月完整性、决策覆盖、LLM 错误率和 DONE 门槛的 run。当前结果是描述性统计,不报告显著性或因果结论。
–
主结局:跨条件月度孤立率
干预期主结局:seed-level 孤立率
论文核心结果:条件均值与有效重复
–
H4 相关结果:撤出反弹与同 seed 配对差值
–
机制层证据:介入时机 · 剂量 · 延迟成本
规则层扫描(20 种子,无 LLM),预注册假设与主指标;绝对水平不与正式 LLM 批次比较,仅比较方向与量级。
–
Harness 自主闭环(设计→运行→评估→修订)
LLM 设计师仅提案,评估为确定性规则层;目标、空间、迭代数预注册,全部轮次落盘无选择性报告。
–
真实成本与失效诊断
调用数为 trace 实测;token/单价为文档化假设。真实成本计入被质量门槛淘汰 run 的沉没部分。
–
数据质量与证据边界
–
模型校准检查,不是干预效果验证
这是当前选中 run 的 n=20 末期截面检查,与 CLHLS 调查年份、样本和指标口径不同,只用于发现模型量级问题。
–
全部模拟轮次(点击行切换查看对象)
| 轮次 | 条件 | 种子 | 进度 | 状态 | 末期孤独 | 末期孤立 | 末期深孤 |
|---|
运行日志(当前选中轮次 · 尾部)
项目介绍
–