AIRESEARCHMETHOD EVALUATION
研究评估
这一页评估的是研究方法本身,不是任何一家公司的结论。每次研究做完时记录一条: 机器指标由工具运行时自己写,阅读评分由人读完报告当场打。
已评估研究2一次研究一条,追加式不改写
阅读评分均分3.8五项各 1–5 分的平均
校验一次通过率50%第 4 步首轮即达标的比例
改变了仓位0 / 2比自评分更诚实的行为指标
未发现缺陷0 / 2合法结果;长期偏高说明这一项在走过场
LEDGER
研究台账
样本量为 2 条,不足 10 条,因此只列台账、不画趋势线—— 几个点连成的折线读不出趋势,只会造成看出了趋势的错觉。
| 公司 | 评分日 | 可信 | 洞察 | 好读 | 可执行 | 密度 | 均分 | 比上次 | 校验 | 干预 / 纠错 | 输出 token | 投入分钟 | skill |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 中国平安保险(集团)股份有限公司 | 2026-08-09 | 4 | 4 | 3 | 4 | 4 | 3.8 | 更好 | 一次过 | 0 / 0 | 465,512 | 39 | 280c597 |
| 盛和资源控股股份有限公司 | 2026-08-08 | 4 | 4 | 5 | 3 | 3 | 3.8 | 差不多 | 0 轮 | — / — | — | — | 1592a7b |
成本指标取自会话日志,取不到时显示 —— 而不是 0;它依赖编辑器的内部日志格式, 因此被有意设计成可缺失。校验轮数与得分取自工具自己写的运行事件,是一等事实。
DEFECTS
最差的一处
五个分数一定会随习惯向上漂移直至饱和,这一条不会——改研究方法时, 改的应该是这里记下的失败,而不是印象里的问题。 「暂时没发现」是合法结果、不产生记录,因此这里的条数少于研究次数是正常的; 但上面那格「未发现缺陷」的比例长期偏高,说明的多半不是报告变好了。
维度总结卡片与策略触发条件的 scoreBasis/basis 字段大量堆砌 dimensions.xxx.yyy 原始字段路径,读起来像内部审计记录而不是给读者的结论,拉低了整体可读性,尤其在管理层与生意质量两个维度最明显。
无
METHOD
怎么读这一页
正确性、依从性、自主性、成本、稳定性都是代理指标,阅读评分才是目的本身。 判定一次研究方法的改动是不是改进,标准是:固定模型与固定任务下,其中至少一项显著提升、 其余不回归、成本不显著变差。任何一项回归都不算改进。
这套自我评价本身也可被怀疑:五项评分会漂移会饱和,真正承载信号的是「最差的一处」 与「是否改变仓位」这两个不易自欺的字段。若台账上的分数长期贴在高位而缺陷仍在稳定产出, 应当相信后者。原始记录在仓库的 research/evals/ 下,逐条可核对。