我们自己跑的实验,附完整数据、真实推理成本,以及失败记录。这里不是客户案例,是实验室报告。
四个模型、各 $50,000、130 个交易日。一个 8B 模型以 +72.6% 夺冠,领先第二名 71 个百分点。随后我们让每个模型在同样的日子里各重跑五次:每个模型自身的波动幅度(13–19 个百分点)竟是模型之间差距(7 个百分点)的两倍。排行榜是噪声。唯一可复现的差异是成本——最贵的模型每次决策要贵 121 倍。