📉 60个AI基准测试,快一半已经废了 刚翻到一篇论文,越看越不对劲。 有人拉了60个大语言模型的基准测试,给每个测试算了一遍"饱和度"。结果将近一半已经饱和,模型之间根本拉不开差距。而且越老的测试,饱和率越高。 你仔细想想,现在是不是这样。 每个新模型一发布,MMLU、GSM8K M. @wlzh · 2026-08-05