
数据、算力与模型
文章来源:通和投研发布时间:2026-07-31
数据、算力与模型
智能的三重根基,与通向未来的窄门
人类文明的历史,在某种意义上是一部不断扩展"计算"边界的历史。从结绳记事到万亿参数的神经网络,我们始终在用三种力量重塑认识世界、改造世界的能力:记录世界的数据、处理信息的算力、以及抽象规律的模型。三者并非 AI 时代的发明,而是贯穿文明史的深层结构。当我们谈论这一轮 AI 大模型革命时,它们被并称为三大支柱——但要预见未来,必须先回到它们的过去。
目 录
1. 一、三柱同源:一部被压缩的文明史
2. 二、科技跃迁中的协同:谁在推动生产力
3. 三、AI 大模型时代:三柱的角色重构
4. 四、未来之争:哪一柱将主导 AI 的下一个十年
5. 五、辩证收束:瓶颈会迁移,但三柱不可分
一、三柱同源:一部被压缩的文明史
把数据、算力和模型放回它们各自诞生的历史现场,会发现一件令人意外的事:它们几乎同时萌发于人类"试图把世界装进符号"的那个瞬间。三者的起源并非彼此独立,而是同一次认知革命的三个侧面。
数据 | 算力 | 模型 |
把经验外化、留存、可复用 | 按规则对符号做机械变换 | 从重复中提炼可复用的规律 |
1.1 数据:从口耳相传到万亿字节
最早的"数据"是记忆。在没有文字的时代,吟游诗人、族谱口述、星象观测者本身就是行走的数据库,靠韵律与仪式对抗遗忘。文字的发明(苏美尔楔形文字约公元前 3200 年)是人类第一次把数据从人脑中卸载到外部载体——而最早的文字,几乎清一色是账本与库存清单。也就是说,数据的外化始于经济核算的需要。
此后每一次跃迁都伴随数据规模的扩张:巴比伦的天文观测表、罗马的人口普查、中世纪修道院的账册、宋代的鱼鳞图册与商税记录。古登堡印刷术(1440)让数据可以低成本复制;科学革命让数据被系统化生产——第谷·布拉赫夜复一夜的行星位置记录,正是开普勒三定律赖以诞生的"训练集"。
进入工业革命,国家与企业的规模催生了现代统计学与官僚制——数据不再只是记录,而成为治理与生产的输入。20 世纪的后半叶,数据库、互联网、传感器把人类推入"信息时代";而今天,全球每天产生约 2.5 EB(艾字节)量级的新数据。数据,从"对抗遗忘"演变为"喂养智能"。
1.2 算力:从手指到晶体管
算力的历史,是一部"把计算从人脑外包给机器"的渐进史。英语中 computer 一词,直到 1940 年代仍主要指"做计算的人"——二战期间编制弹道表的"human computers"多为女性数学家。在这之前是算盘、纳皮尔筹、对数计算尺;帕斯卡的加法机(1642)、莱布尼茨的阶梯计算器,把"按规则变换符号"这件事机械化。
真正的概念突破来自巴贝奇:他在 1820—30 年代设计的差分机与分析机,第一次提出"通用可编程计算"的构想——惜乎受限于机械加工精度而未能完成。1890 年美国人口普查采用霍勒瑞斯的穿孔卡机电制表机,让原本耗时数年的统计在数周内完成,直接催生了 IBM 的前身。图灵在 1936 年为"可计算"给出了数学定义,ENIAC(1945)则在物理上实现了它。
此后是一条加速曲线:晶体管(1947)、集成电路(1958)、摩尔定律(1965)预言的指数增长、微处理器(1971)、GPU 与 CUDA(2007)、TPU 与专用 AI 芯片。算力的每一次跃升,都把"什么问题可解"的边界向外推开一格。值得注意的是——算力并非匀速前进,而是呈指数曲线,而指数曲线的关键属性是:每一代都让上一代显得近乎静止。
1642 / 1673 帕斯卡、莱布尼茨机械计算器——计算机械化
1822—1837 巴贝奇差分机/分析机——通用可编程的构想
1890 霍勒瑞斯穿孔卡制表机——机电数据处理
1936 / 1945 图灵机理论 / ENIAC——电子计算时代开启
1947 / 1958 / 1965 晶体管 / 集成电路 / 摩尔定律
2007 / 2016 CUDA / TPU——算力转向 AI 专用化
1.3 模型:从公理到神经网络的数理谱系
"模型"在这篇文章里取其最宽的意涵——从重复的经验中提炼出可复用的、关于世界如何运行的抽象。它的源头比数据与算力更古老:欧几里得几何与毕达哥拉斯定理,是人类最早一批"世界可被数学化"的宣言。一根直尺、一组公理,竟能推出无穷命题——这种"以小博大"的抽象能力,就是模型的原型。
近代意义上的模型理论,则诞生于概率与统计:帕斯卡与费马(1654)对赌局的研究开启概率论;高斯与勒让德的最小二乘法从噪声中拟合行星轨道;贝叶斯定理给出"用新证据更新信念"的形式化框架——这几乎就是今天机器学习的认识论内核。统计力学(玻尔兹曼、吉布斯)从微观粒子推出宏观热力学规律,与现代神经网络从样本推出分布,在数学上同源。
20 世纪,模型走向了"学习"本身。麦卡洛克-皮茨神经元(1943)把思维形式化为逻辑门;罗森布拉特的感知机(1958)第一次让机器从数据中"学"出一个判别函数;明斯基的批判(1969)使其陷入第一次寒冬;反向传播(鲁梅尔哈特等,1986)解开了多层网络的可训练性;瓦普尼克的统计学习理论与 VC 维,给出了泛化能力的数学刻画。再到 2006 年 Hinton 的深度信念网络、2012 年 AlexNet 在 ImageNet 上一举夺冠、2017 年《Attention is All You Need》提出 Transformer、2020 年起的缩放律(Scaling Laws)——模型的演化是一条"抽象越来越深、表达越来越广"的单向通道。
有趣的一致性:数据从记忆→账本→数据库→语料,算力从手→机械→电子→专用芯片,模型从公理→统计→神经网络→大模型。三者的历史节拍并不相同步,却始终相互咬合——每当一者出现瓶颈,另两者便会赶来解围,反之亦然。
二、科技跃迁中的协同:谁在推动生产力
把三柱放进生产力演进的坐标系,能看清它们各自的角色,以及为何缺一不可。
历史阶段 | 数据的角色 | 算力的角色 | 模型的角色 |
农业/早期文明 | 口述、账册、历法——支撑治理与协作 | 人力、算盘——有限且昂贵 | 经验法则、占星、几何——少数精英掌握 |
科学革命 | 系统观测记录成为方法(第谷→开普勒) | 对数、计算尺——放大单人计算力 | 数学化定律——自然被"公式化" |
工业革命 | 统计、普查、企业账簿——规模化治理 | 机械计算器、制表机——批量处理 | 力学与热力学模型——指导工程设计 |
信息时代 | 数据库、互联网——数据成为资产 | 通用计算机、摩尔定律——指数增长 | 运筹学、控制论、统计学习——优化决策 |
AI 时代 | 海量多模态语料——智能的"养料" | GPU/TPU 集群——智能的基础设施 | 深度网络、Transformer——智能的架构 |
这张表透露出一个规律:三柱的相对稀缺性在不同时代来回迁移,而每一次重大跃迁,都发生在三者同时突破某个阈值的交汇点。
开普勒的例子堪称典范:第谷积累的、当时精度最高的天文数据(数据),加上开普勒本人及同时代数学家的手算能力(算力),再加上开普勒敢于放弃"圆周运动"这一千年模型、改用椭圆的抽象勇气(模型),三者缺一,就不会有行星运动三定律。这几乎就是"缩放律"在 17 世纪的预演。
再比如,神经网络之所以在 1958—2012 的半个世纪里两度受挫又两度复兴,正是三柱错配的直接结果:感知机时代,数据太少、算力太弱,明斯基用 XOR 一击即中;反向传播时代,理论已成熟,但 CPU 算力与标注数据仍不足,于是深网训练不动;直到 2012 年,ImageNet 提供了百万级标注(数据),GPU 提供了足够并行算力(算力),ReLU 与 Dropout 提供了可训练的深层结构(模型),三者交汇,AlexNet 一夜成名。AI 的冬天不是哪一个冬天,而是三柱长期错配的冬天。
从生产力角度看,三柱各自的"乘数效应"也不相同:数据是规模型的——多一份数据,可复用的次数随之增加;算力是杠杆型的——一次硬件升级,能让所有模型都跑得更快;模型是范式型的——一次架构突破(如 Transformer),可以让同样多的数据与算力产生数量级的更好效果。换言之,数据线性叠加,算力横向放大,模型则能改写游戏规则。
数据决定上限,算力决定速度,模型决定形状。
三、AI 大模型时代:三柱的角色重构
这一轮以大语言模型为代表的 AI 革命,之所以与以往不同,在于三柱第一次被同时、规模化、相互正反馈地投入同一种方法(深度学习)之下。理解三柱在当下的新角色,是判断未来的前提。
3.1 数据:从"经验"到"世界分布的压缩"
在大模型语境下,预训练数据不再是"训练样本",而是人类可读世界的分布。模型通过预测下一个 token,本质上是在对这份数据做高维压缩——压缩率越高、压缩得越忠实,泛化能力越强。于是数据的角色被重新定义:它不再是"标注好的题库",而是"世界的文本投影"。
这也带来当下的核心焦虑——高质量文本数据是否会被耗尽。据多项估算,互联网上高质量、去重后的英文文本大约在 4—20 万亿 token 量级,而当前最大模型的训练已逼近这一量级的相当比例。"数据墙"成为最被频繁讨论的瓶颈。
但"数据"本身在被重新定义:合成数据(让强模型生成、弱模型学习)、多模态数据(把视觉、视频、动作流纳入"世界投影")、强化学习中的奖励信号与可验证反馈(RLHF / RLVF)、乃至机器人与物理世界的交互数据——都在拓宽"数据"的边界。瓶颈未必是数据的枯竭,而是高质量、富含信号密度数据的枯竭。
3.2 算力:从"工具"到"智能的基础设施"
过去算力是"跑程序的工具",今天算力正在成为"生产智能的基础设施"。这一身份跃迁意味着两件事:其一,算力像电力一样,成为社会基础设施;其二,算力的形态开始分化——训练算力(大规模、集中、对带宽极度敏感)与推理算力(规模、时延、成本敏感)成为两条不同的工程曲线。
更深刻的变化发生在算法层面。算力不再只是被消耗,而被"重新分配"到训练与推理之间。OpenAI o1 系列所代表的"测试时计算"(test-time compute)范式表明:在推理阶段投入更多算力进行"思考",可以换来回答质量的显著提升。这等于把算力的边际效用从训练侧迁移到了推理侧——算力不再只决定"学得多快",也决定"想得多深"。
但算力的扩张正面临三重物理约束:摩尔定律放缓带来的制程极限、先进封装与 HBM 供给瓶颈、以及越来越不容忽视的能源与碳排放。下一代算力的争夺,已不仅是芯片之争,而是芯片—能源—冷却—网络的系统之争。
3.3 模型:从"架构"到"智能的形态学"
在 Scaling Laws 的叙事里,模型常常被简化为一个"参数量"数字。这是一种低估。模型这一柱,真正承载的是智能的形态——它决定算力被如何组织、数据被如何压缩。
Transformer 的伟大之处,不在于它"更大",而在于它去除了循环与卷积的归纳偏置,让序列建模可以充分并行、充分堆叠,从而使缩放律成为可能。没有这个架构选择,再多的数据与算力也压不进同一个网络。这正印证了 Sutton 所说的"苦涩的教训":那些允许规模化、允许用算力与数据换效果的通用方法,最终会胜过所有精巧的手工归纳偏置。
当下模型的演化方向已分化为多条线索:混合专家(MoE)在不增加推理成本的前提下扩大参数;状态空间模型(Mamba 等)挑战 Transformer 的长序列效率;多模态架构把视觉、音频、动作统一进同一表征空间;世界模型与具身智能试图让模型理解物理因果而非仅仅是文本统计。模型这一柱,正在从"更大的网络"走向"更对的组织方式"。
四、未来之争:哪一柱将主导 AI 的下一个十年
这是本文的核心问题。三柱都有自己坚定的拥趸,各自的论据也都成立。我们逐一来听。
4.1 数据派的论据
●高质量文本正在见顶。若高质量数据是模型能力的硬上限,那么数据就是第一约束。谁掌握独有、高质量、私有或多模态数据,谁就握有下一轮的入场券。
●数据是模型"世界知识"的唯一来源。再大的算力、再好的架构,也无法从空气中凭空生成知识。数据决定模型"知道什么"。
●合成数据可能存在模型崩溃。若递归地用模型生成数据训练下一代模型,分布会坍缩、多样性会下降——这意味着"真实世界数据"的不可替代性。
4.2 算力派的论据
●Scaling Laws 至今未被证伪。过去十年最大、最稳定的经验规律是:给更多算力,损失就继续下降。这条曲线本身就在为算力背书。
●算力是"可堆叠"的工程投入。模型创新不可预测、数据质量难以保证,但买更多卡、建更大集群、拼更大能源,是确定可执行的——算力是资本主义最容易理解的那一柱。
●推理算力的崛起打开新维度。测试时计算让算力从"一次性训练投入"变成"持续可扩张的能力来源",等于给算力派续了一段命。
4.3 模型派的论据
●算法突破能带来数量级跃迁。Transformer 相对 RNN 不是改良而是革命;MoE、状态空间模型、更好的优化与归一化,每一次都对算力/数据效率有数倍提升。模型是唯一能在不增数据、不增算力前提下提升能力的一柱。
●数据与算力都有物理上限,模型理论暂无可见天花板。文本数据会耗尽、芯片制程会撞墙、能源会被约束,但"如何更高效地组织计算与压缩数据"这件事,没有明显的物理下界。
●"苦涩的教训"指向模型方向。Sutton 的判断是历史规律:凡是能转化为"用算力与数据解决问题"的通用方法,都会胜过精巧的人工设计。这意味着未来最有价值的,是那些把更多算力与数据转化为智能的架构与训练范式——这正是模型一柱的核心。
4.4 三派的隐含共识
若仔细听,三派的分歧远比表面小。数据派真正担心的,是"信号的稀缺";算力派真正押注的,是"规模的红利";模型派真正追求的,是"效率的边界"。三者其实指向同一个问题:给定有限的物理资源,如何最大化从数据中提取的智能。
因此与其问"哪一柱更重要",不如问"下一阶段,哪一柱会成为瓶颈"——因为瓶颈会迁移,而瓶颈所在的柱,就是那个阶段最重要的一柱。
五、辩证收束:瓶颈会迁移,但三柱不可分
借用李比希(Liebig)的"最小因子律"来理解这件事再合适不过:植物的生长受限于最缺乏的那种养分;当那种养分被补足后,瓶颈会转移到下一种。数据、算力与模型,正构成 AI 生长的三种养分,而瓶颈一直在它们之间迁移。
过去十年(2012—2022),瓶颈主要在算力:谁能把网络堆深、把集群做大,谁就领先。于是 GPU 厂商成为时代主角。
最近两三年(2023—2025),瓶颈迅速向数据迁移:高质量文本趋紧,于是合成数据、多模态、强化学习反馈成为新前沿,数据飞轮与数据护河成为公司战略。
而当下与可预见的未来,瓶颈正在向模型/算法迁移:单纯靠堆卡与堆数据的边际收益开始递减,业界开始追问"下一个 Transformer 在哪里"、"如何让推理算力高效转化为推理质量"、"如何让模型真正理解物理世界而非复述文本"。当数据与算力都接近各自的物理与经济边界时,模型这一柱——架构、训练范式、目标函数、表征与推理方式——将再次成为决定性的变量。
但这并不意味着可以轻言数据与算力退场。恰恰相反:
●数据的边界正在被多模态、具身交互、可验证反馈重新撑开——真实世界的数据,依然是智能的最终源头。
●算力的边界正在被能源、先进封装、专用芯片、乃至光子与量子计算重新定义——算力是智能得以存在的物质基础。
●模型的边界则在于"如何更高效地把前两者转化为智能"——模型是智能的形态学,决定上限的形状。
数据是土地,算力是耕作之力,模型是作物之法。沃土与机器让人吃得饱,但唯有更聪明的种法,才能在同样的土地上养活更多的人。
所以,若必须给出一个判断:在短期(未来 3—5 年),数据仍将是最紧的瓶颈,独有、高质量、多模态与可验证数据将决定谁能领跑;在中期(5—10 年),算力的物理与能源约束会重新成为天花板,专用芯片、能源与冷却会成为大国与企业的新角力场;在长期,当数据与算力各自逼近物理极限,模型这一柱——抽象、架构与训练范式的创新——将成为唯一能持续打开天花板的力量。因为它不与物理资源争夺上限,而与人类的想象力争夺上限。
而这,或许正是这轮 AI 革命最深的隐喻:人类第一次制造出一种"在土地上耕作、却同时改写种法"的工具。数据是它走过的世界,算力是它迈步的气力,模型是它学会的走路方式——三者一体,才有了今天我们看到的、跌跌撞撞却步幅惊人的"智能"。未来谁更重要,取决于我们在哪一段路上。但有一件事可以确定:三者同源而生,也将同源而进。任何只押注其中一柱而忽视其余的战略,最终都会被另外两柱的瓶颈所纠正。
本文按"数据、算力、模型"三柱的历史—当下—未来脉络组织,力求辩证而非站队。文中涉及的缩放律、数据墙、测试时计算、混合专家、状态空间模型等均为当前活跃的研究方向,其结论仍在演化。
—— 写于三者同源之处。