AIRESEARCHMETHOD EVALUATION

研究评估

这一页评估的是研究方法本身,不是任何一家公司的结论。每次研究做完时记录一条: 机器指标由工具运行时自己写,阅读评分由第 7 步的阅读评分 Agent 读完报告当场打, 操作者只补充自己才知道的行为两问。分数只按同一评分源的趋势读,不跨源横比。

已评估研究20一次研究一条,追加式不改写
阅读评分均分3.8五项各 1–5 分的平均
校验一次通过率90%第 4 步首轮即达标的比例
改变了仓位5 / 17仅计人工已答;比自评分更诚实的行为指标
未发现缺陷2 / 20合法结果;长期偏高说明这一项在走过场

LEDGER

研究台账

阅读评分均分,自左向右由旧到新;虚线为 3 分。纵轴固定 1–5 分。
公司评分日可信洞察好读可执行密度均分比上次评分人校验干预 / 纠错输出 token投入分钟skill
快手科技 / Kuaishou Technology2026-09-15554544.6更好人工一次过— / ———06bc26a
泡泡玛特国际集团有限公司 (Pop Mart International Group Limited)2026-09-14454444.2差不多评分 Agent一次过— / ———28d10db
名创优品集团控股有限公司 (MINISO Group Holding Limited)2026-09-14444433.8差不多人工一次过— / ———156de01
网易云音乐股份有限公司 (NetEase Cloud Music Inc.)2026-09-06444433.8更好人工一次过— / ———9fdeb0d
理想汽车 (Li Auto Inc.)2026-09-03454444.2差不多人工10 轮3 / —137,6642774ee3de
富途控股 Futu Holdings Limited2026-08-25454444.2更好人工一次过— / 0——ba516b5
网易云音乐股份有限公司 (NetEase Cloud Music Inc.)2026-08-20443433.6差不多人工一次过0 / —399,4965256b2162
快手科技 / Kuaishou Technology2026-08-20454544.4更好人工一次过5 / —433,77760803b7ce
腾讯控股有限公司 (Tencent Holdings Limited)2026-08-19444433.8差不多人工一次过2 / —427,254541d04bbe
贵州茅台酒股份有限公司2026-08-17444544.2更好人工一次过3 / —137,664273b6f564
AMD (Advanced Micro Devices)2026-08-12424433.4差不多人工一次过3 / —137,66427c3d080c
腾讯音乐娱乐集团 (Tencent Music Entertainment Group)2026-08-12444433.8更好人工一次过1 / —513,44566e90afc1
招商银行股份有限公司 (China Merchants Bank)2026-08-10453544.2更好人工一次过0 / —746,71968b5e11f8
MiniMax Group Inc.(稀宇科技,同股不同权,A/B 双层股权架构)2026-08-10434233.2差不多人工一次过6 / —429,847789221d69
AMD (Advanced Micro Devices)2026-08-09424433.4差不多人工一次过3 / 0137,66427f759c0b
Netflix, Inc.2026-08-09434433.6差不多人工一次过2 / —425,2845473ea7d8
中国长江电力股份有限公司2026-08-09443433.6差不多人工一次过0 / 0365,97335bb9e0e0
快手科技 / Kuaishou Technology2026-08-09434233.2更差人工一次过5 / —432,00659d0de45a
中国平安保险(集团)股份有限公司2026-08-09443443.8更好人工一次过0 / 0465,51239280c597
盛和资源控股股份有限公司2026-08-08445333.8差不多人工0 轮— / ———1592a7b

评分人列区分人工与评分 Agent:绝对分数不能跨源比较,按同一评分源的 时间序列看趋势才有意义。成本指标取自会话日志,取不到时显示 —— 而不是 0; 它依赖编辑器的内部日志格式,因此被有意设计成可缺失。校验轮数与得分取自 工具自己写的运行事件,是一等事实。

DEFECTS

最差的一处

五个分数一定会随习惯向上漂移直至饱和,这一条不会——改研究方法时, 改的应该是这里记下的失败,而不是印象里的问题。 「暂时没发现」是合法结果、不产生记录,因此这里的条数少于研究次数是正常的; 但上面那格「未发现缺陷」的比例长期偏高,说明的多半不是报告变好了。

METHOD

怎么读这一页

正确性、依从性、自主性、成本、稳定性都是代理指标,阅读评分才是目的本身。 判定一次研究方法的改动是不是改进,标准是:固定模型与固定任务下,其中至少一项显著提升、 其余不回归、成本不显著变差。任何一项回归都不算改进。

这套自我评价本身也可被怀疑:五项评分会漂移会饱和,真正承载信号的是「最差的一处」 与「是否改变仓位」这两个不易自欺的字段——后者只由操作者本人回答,评分 Agent 无从代答。若台账上的分数长期贴在高位而缺陷仍在稳定产出,应当相信后者。 原始记录在仓库的 research/evals/ 下,逐条可核对。

← 回到公司研究