EVAL ATLAS 评测演进研究图谱
THE EVOLUTION OF AI EVALUATION 研究版 / 2026.10

从“像人”到“有用”
AI 评测的演进全景

每一次能力跃迁,都在改写衡量智能的尺子。
沿着 76 年的代表性节点,看评测如何从一道题,走向一个真实世界。

THE EXPANDING QUESTION 评测边界持续外扩
会模仿吗?能答对吗?会泛化吗?值得信任吗?能把事做完吗? 19502026
单点能力 → 系统表现 概念示意 / 非量化数据
贯穿全图的主线

评测的对象正在扩大,
“高分”的含义变得更具体。

1950–2026历史跨度
—精选里程碑
6并行演进赛道
5值得关注的转向
01 / THE PANORAMA

一张图,看见评测的演进

横向看阶段,纵向看赛道。
点击节点,打开它的意义、指标与盲区。

赛道
阶段
按阶段分栏,非等距时间轴;分期与分类为编辑归纳。左右滚动查看完整图谱
02 / FIVE SHIFTS

尺子为什么不断变长?

新评测补上旧评测的盲区。
以下为基于代表性文献的趋势归纳。

03 / READING A SCORE

一个分数,到底说明什么?

选择一种评测方式,看看它能回答什么,
又把哪些问题留在了分数之外。

≠
分数可比较的前提,是评测条件可比较。

检查数据版本、测试划分、提示词、工具权限、采样次数、计算预算和置信区间;跨基准的百分比不构成同一条“智能进步曲线”。

04 / RESEARCH NOTES

来源与阅读口径

01

节点如何入选

选取推动评测方法、任务范围或使用场景发生变化的代表性节点。包含思想实验、指标、数据集和评测框架,并非完整目录或权威排名。

02

年份如何标记

优先记录首次公开论文或正式发布;必要时同时注明会议年份。资料核查截至 2026 年 10 月 3 日,未发布的路线图不作为已发生事件。

03

趋势如何阅读

六条赛道、历史分期与五大趋势为编辑归纳。后来的评测并未取代先前方法;节点密度反映本图的选取,不代表研究数量或市场份额。

展开全部一手来源
    EVAL ATLAS / AI 评测发展历史趋势

    从衡量答案,到理解能力的边界。

    回到顶部 ↑
    SIDE BY SIDE

    把不同的尺子放在一起

    比较评测目的与口径,不比较不同基准的分数。