知了AI学习平台Logo知了
📅AI时间线 · 72

AI时间线

从 1950 年图灵测试到 2025 年 AI Agent 时代,一览改变世界的关键时刻

共 72 个事件· 点击分类筛选

🧠
1950
里程碑

图灵测试提出

艾伦·图灵在论文《计算机器与智能》中提出"模仿游戏",即著名的图灵测试:如果一台机器能通过文字对话让人类无法分辨其是否为机器,则可认为它具有智能。这是首次以可操作的方式定义人工智能,奠定了 AI 评价的哲学基础。

影响

图灵测试定义了人工智能的第一个可量化标准,引发了"机器能否思考"的持续讨论,至今仍是 AI 哲学的核心议题,也启发了后来 ELIZA、ChatGPT 等对话系统的开发。

深入了解
🎓
19561956年夏
里程碑

达特茅斯会议

约翰·麦卡锡、马文·明斯基、克劳德·香农等人在达特茅斯学院组织了为期两个月的研讨会,首次提出"人工智能"(Artificial Intelligence)一词。会议确立了 AI 作为独立学科的地位,定义了其核心目标:让机器表现出类似人类的智能行为。

影响

达特茅斯会议标志着人工智能作为一门独立学科的诞生,参与者后来成为 AI 领域的奠基人,影响了此后数十年的研究方向,被认为是 AI 历史上最重要的里程碑事件。

深入了解
⚡
1958
模型

感知机发明

弗兰克·罗森布拉特发明了感知机,这是第一个可以学习的神经网络模型。感知机模拟生物神经元,通过调整权重实现线性分类。它在 IBM 704 计算机上实现了识别简单图像的演示,引发了巨大轰动。

影响

感知机是神经网络和机器学习的起点,证明了机器可以通过学习获得分类能力。它启发了后来的多层感知机和深度学习,为现代神经网络的权重更新机制奠定了基础。

深入了解
💬
1965
工具

ELIZA 对话系统

约瑟夫·魏泽鲍姆在 MIT 开发了 ELIZA,这是最早的聊天机器人之一。ELIZA 模拟心理治疗师,通过模式匹配和简单规则生成回复。尽管没有真正的理解能力,许多用户却对它产生了情感依赖,这让魏泽鲍姆深感不安。

影响

ELIZA 展示了简单规则系统也能产生令人惊讶的对话效果,揭示了人类倾向于将机器行为拟人化的心理倾向。它引发了对 AI 伦理的早期思考,是现代对话机器人的原型。

深入了解
❄️
1969
概念

感知机局限性揭示

马文·明斯基和西摩·帕珀特出版《感知机》一书,严格证明了单层感知机无法解决 XOR(异或)等线性不可分问题。虽然书中也指出多层网络可能解决这些问题,但当时缺乏有效的训练算法,这一结论被广泛误解为神经网络无前途。

影响

这本书直接导致了第一次 AI 寒冬,神经网络研究资金锐减、研究转向符号主义。直到近 20 年后反向传播算法普及,神经网络才重新崛起。它警示了技术评估需避免过度悲观。

深入了解
📋
1980
里程碑

专家系统兴起

基于规则的专家系统在 1980 年代商业化成功,DENDRAL(化学分析)、MYCIN(血液感染诊断)等系统通过编码领域专家的 if-then 规则,在特定领域达到甚至超越人类专家水平。专家系统催生了第一个 AI 商业化浪潮。

影响

专家系统证明了 AI 的商业价值,催生了数十亿美元的产业。但其知识获取瓶颈和脆弱性(无法处理规则外情况)最终导致第二次 AI 寒冬,也推动了后来数据驱动的机器学习方向。

深入了解
🔄
1986
突破

反向传播算法普及

大卫·鲁梅尔哈特、杰弗里·辛顿等人系统阐述了反向传播算法,通过链式法则高效计算多层神经网络的梯度,使训练深层网络成为可能。这一突破让神经网络研究走出低谷,重新成为 AI 主流方向。

影响

反向传播是深度学习的基石算法,至今仍是所有神经网络训练的核心。它使多层网络可以有效学习非线性表示,直接催生了后来的卷积网络、循环网络和 Transformer 等架构。

深入了解
🔢
1989
模型

卷积神经网络雏形

杨立昆在 AT&T 贝尔实验室将卷积神经网络应用于手写数字识别,该系统后来被美国银行用于支票自动读取,每天处理数百万张支票。这是神经网络首次在大规模商业应用中取得成功。

影响

这是 CNN 首次证明其在实际工业场景中的价值,卷积操作有效利用了图像的局部性和平移不变性。这一成功为后来 LeNet-5 和更深的视觉网络铺平了道路。

深入了解
♟️
19971997年5月
里程碑

深蓝击败国际象棋世界冠军

IBM 的深蓝超级计算机在六局比赛中以 3.5:2.5 击败国际象棋世界冠军加里·卡斯帕罗夫。深蓝每秒可评估 2 亿个棋局位置,主要依靠算力穷举和专家规则,而非现代意义上的机器学习。

影响

这是机器首次在智力博弈中战胜人类世界冠军,震撼了公众对 AI 能力的认知。它证明了在规则明确的问题上,算力加搜索可以超越人类,也引发了"AI 是否终将超越人类"的广泛讨论。

深入了解
🔁
1997
模型

LSTM 长短期记忆网络

塞普·霍赫赖特和于尔根·施密德胡伯提出长短期记忆网络(LSTM),通过门控机制(输入门、遗忘门、输出门)解决 RNN 的梯度消失问题,使网络能够学习长距离依赖关系。

影响

LSTM 在此后近 20 年里是序列建模的统治性架构,广泛应用于机器翻译、语音识别、文本生成等任务,直到 Transformer 出现才被取代。它证明了精心设计的门控可以突破梯度难题。

深入了解
🏛️
1998
模型

LeNet-5 卷积神经网络

杨立昆正式发表 LeNet-5 架构,这是第一个完整成熟的卷积神经网络,包含卷积层、池化层和全连接层。LeNet-5 在手写数字识别(MNIST)上达到极高精度,定义了 CNN 的经典范式。

影响

LeNet-5 确立了卷积-池化-全连接的经典 CNN 架构,影响了此后所有视觉网络的设计。它证明了对图像先验(局部性、平移不变性)的归纳偏置能极大提升效率和效果。

深入了解
🌊
2006
突破

深度学习复兴

杰弗里·辛顿等人提出深度信念网络(DBN)和逐层预训练方法,解决了深层网络难以训练的问题。辛顿提出"深度学习"一词,标志着神经网络研究以新面貌回归主流。

影响

这次复兴重新点燃了学界对深层神经网络的信心,为 2012 年 AlexNet 的突破奠定了理论基础。"深度学习"一词从此成为 AI 最核心的关键词,开启了持续至今的浪潮。

深入了解
🖼️
2009
工具

ImageNet 数据集发布

李飞飞团队发布 ImageNet 数据集,包含 1400 万张标注图像、2 万个类别,是当时最大的人工标注图像数据集。ImageNet 还设立了年度视觉识别挑战赛(ILSVRC),成为深度学习竞赛的标志性平台。

影响

ImageNet 证明了"数据是 AI 的燃料",大规模高质量标注数据是深度学习成功的前提。它直接催生了 AlexNet 等突破性模型,并推动了整个计算机视觉领域的爆发式发展。

深入了解
📺
20112011年2月
里程碑

IBM Watson 赢得 Jeopardy

IBM 的 Watson 系统在美国问答节目《Jeopardy!》中击败两位人类冠军。Watson 综合运用自然语言理解、知识检索和概率推理,能在理解模糊题目后快速从海量知识库中找到答案。

影响

Watson 证明了 AI 在自然语言问答领域的潜力,展示了知识检索与推理结合的价值。虽然 Watson 后来商业化不及预期,但它预示了十年后大语言模型在问答领域的全面突破。

深入了解
🗣️
20112011年10月
工具

Siri 语音助手发布

苹果在 iPhone 4S 中集成 Siri,这是首个面向大众消费者的 AI 语音助手。Siri 能理解自然语言指令并执行设定闹钟、查询天气、发送短信等操作,将 AI 从实验室带入日常生活。

影响

Siri 开创了消费级 AI 助手时代,让普通用户首次体验与 AI 的自然交互。它催生了 Alexa、Google Assistant 等竞品,推动了语音识别和自然语言理解技术的快速商业化。

深入了解
🚀
20122012年9月
突破

AlexNet 赢得 ImageNet 竞赛

亚历克斯·克里泽夫斯基、伊利亚·苏茨克维和杰弗里·辛顿的 AlexNet 在 ImageNet 大规模视觉识别挑战赛中将错误率从 26% 降至 15.3%,以巨大优势夺冠。AlexNet 使用 8 层深度卷积网络、ReLU 激活、Dropout 正则化和 GPU 训练。

影响

AlexNet 是深度学习革命的引爆点,证明了深层 CNN 配合 GPU 和大数据可以碾压传统方法。它直接引发了计算机视觉、语音识别和自然语言处理等领域的深度学习浪潮,改变了整个 AI 格局。

深入了解
📐
2013
模型

Word2Vec 词嵌入

托马斯·米科洛夫等人在 Google 提出 Word2Vec,通过浅层神经网络将词语映射为密集向量,使语义相似的词在向量空间中相近。Word2Vec 揭示了"国王-男人+女人=女王"这样的语义算术关系。

影响

Word2Vec 让词表示从稀疏离散的 one-hot 进化为密集连续的语义向量,是现代 NLP 的基础。它启发了后续的 GloVe、ELMo、BERT 等表示学习,将"分布式表示"理念推向极致。

深入了解
🎭
2014
模型

生成对抗网络 GAN

伊恩·古德费洛提出生成对抗网络,由生成器和判别器两个网络相互博弈:生成器尝试生成逼真样本欺骗判别器,判别器尝试区分真实与生成样本。两者对抗训练最终使生成器能产生以假乱真的数据。

影响

GAN 开创了深度生成模型的新范式,在图像生成、风格迁移、数据增强等领域广泛应用。它启发了 StyleGAN、CycleGAN 等变体,是生成式 AI 的重要里程碑,杨立昆称其为"20 年来最酷的 AI 想法"。

深入了解
🔤
2014
模型

Seq2Seq 序列到序列模型

谷歌的 Ilya Sutskever 等人提出 Sequence-to-Sequence 模型,用编码器-解码器架构将输入序列编码为固定向量再解码为输出序列,实现了端到端的机器翻译,无需人工设计特征。

影响

Seq2Seq 将神经机器翻译的质量大幅提升,逐步取代统计机器翻译。它的编码器-解码器思想被后来的 Transformer 继承和发扬,成为现代 NLP 生成任务的基础架构。

深入了解
⚙️
2014
工具

Adam 优化器

迪德里克·金马和吉米·巴提出 Adam 优化器,结合 Momentum 的惯性加速和 RMSProp 的自适应学习率,为每个参数维护一阶矩和二阶矩的指数移动平均,成为深度学习中最常用的优化算法。

影响

Adam 凭借快速收敛和较少调参成为深度学习事实上的默认优化器,被广泛应用于从 CNN 到 Transformer 的几乎所有模型训练。它的简洁和有效性使其成为工程师的首选。

深入了解
🔗
2015
模型

ResNet 残差网络

何恺明等人在微软研究院提出残差网络(ResNet),通过引入跳跃连接让梯度可以直通深层,成功训练了 152 层的极深网络。ResNet 在 ImageNet 上以 3.57% 的错误率夺冠,超越人类水平(约 5%)。

影响

ResNet 解决了深层网络的梯度消失和退化问题,使网络深度从几十层扩展到上千层。残差连接成为现代深度网络的标配组件,深刻影响了 Transformer 等架构的设计,是深度学习最重要的架构创新之一。

深入了解
📐
20152015年11月
工具

TensorFlow 开源

Google 开源 TensorFlow 深度学习框架,基于数据流图计算模型,支持分布式训练和多平台部署。TensorFlow 凭借 Google 的背书和完善的生产部署生态,迅速成为工业界主流框架。

影响

TensorFlow 大幅降低了深度学习的工程门槛,推动了 AI 在各行各业的普及。它与 PyTorch 形成双雄并立的格局,其生产部署工具链(TF Serving、TF Lite)至今在工业界广泛使用。

深入了解
围棋
20162016年3月
里程碑

AlphaGo 击败李世石

DeepMind 的 AlphaGo 在五局围棋比赛中以 4:1 击败世界冠军李世石。AlphaGo 结合深度神经网络、蒙特卡洛树搜索和强化学习,通过自我对弈学习围棋策略,攻克了这个被认为 AI 需数十年才能突破的复杂博弈。

影响

AlphaGo 是 AI 发展史上的标志性事件,打破了"机器无法在围棋上战胜人类"的共识。它展示了深度学习与强化学习结合的巨大潜力,极大提升了公众和资本对 AI 的信心,开启了 AI 新一轮投资热潮。

深入了解
🏗️
20172017年6月
突破

Transformer 架构发表

Google 的 Ashish Vaswani 等人在论文《Attention Is All You Need》中提出 Transformer 架构,完全摒弃循环结构,仅用自注意力机制建模序列依赖。Transformer 支持高度并行化,在翻译任务上刷新纪录。

影响

Transformer 是现代 AI 最重要的架构创新,自注意力机制成为 NLP 乃至多模态的统一基础。GPT、BERT、ViT、Stable Diffusion 等几乎所有现代大模型都基于 Transformer,它彻底改变了深度学习的格局。

深入了解
🔥
20172017年1月
工具

PyTorch 开源

Facebook(Meta)AI 研究院开源 PyTorch 框架,以动态计算图、Pythonic 的 API 设计和直观的调试体验著称。PyTorch 更贴近研究者的使用习惯,迅速在学术界获得青睐。

影响

PyTorch 凭借易用性和灵活性逐步超越 TensorFlow 成为学术界主流,HuggingFace 生态更是以 PyTorch 为核心。它极大加速了 AI 研究的迭代速度,成为深度学习研究的首选框架。

深入了解
🏆
20172017年12月
突破

AlphaZero 自我对弈精通棋类

DeepMind 发布 AlphaZero,仅通过自我对弈强化学习(完全不使用人类棋谱数据)在数小时内掌握国际象棋、围棋和日本将棋,并全面超越此前的专用程序。AlphaZero 将 AlphaGo 的技术泛化为通用博弈算法,从零开始发现超越人类知识的策略。它证明了纯强化学习在复杂博弈中具有惊人的潜力,是继 AlphaGo 之后的又一里程碑。

影响

AlphaZero 证明了"从零学习"能够超越人类先验知识,启发后来 MuZero 等更通用的算法。它对通用智能、规划与世界模型的研究产生深远影响,也推动了自我对弈方法在更多领域的应用。

深入了解
📚
20182018年10月
模型

BERT 预训练语言模型

Google 发布 BERT(Bidirectional Encoder Representations from Transformers),通过掩码语言建模(MLM)进行双向预训练,在 11 项 NLP 基准上刷新纪录。BERT 证明了大规模预训练加微调的范式优势。

影响

BERT 开创了预训练语言模型时代,"预训练+微调"成为 NLP 标准范式。它将下游任务的标注数据需求大幅降低,推动了 NLP 在搜索、问答、分类等场景的工业化落地,是 Transformer 应用的里程碑。

深入了解
🤖
20182018年6月
模型

GPT-1 发布

OpenAI 发布第一代 GPT(Generative Pre-trained Transformer),采用 Transformer 解码器架构,通过自回归语言建模预训练加监督微调,在多项 NLP 任务上达到接近 SOTA 的表现,证明了生成式预训练的有效性。

影响

GPT-1 确立了"无监督预训练+有监督微调"的生成式路线,与 BERT 的判别式路线形成对照。虽然 GPT-1 影响力不及 BERT,但它开启了 GPT 系列的进化之路,最终在 GPT-3 时代展现出惊人潜力。

深入了解
✍️
20192019年2月
模型

GPT-2 发布

OpenAI 发布 GPT-2,参数量达 15 亿,能生成连贯流畅的长文本,质量令人惊叹。由于担心被滥用生成假新闻,OpenAI 最初以"过于危险"为由分阶段发布,引发了关于 AI 安全和负责任发布的广泛讨论。

影响

GPT-2 展示了规模化语言模型的强大生成能力,"涌现能力"初现端倪。OpenAI 的谨慎发布策略将 AI 安全议题推上公共讨论舞台,也预示了更大规模模型将带来的变革与风险。

深入了解
🎮
20192019年1月
里程碑

AlphaStar 战胜星际争霸职业选手

DeepMind 的 AlphaStar 在星际争霸 II 中击败职业选手。星际争霸是不完全信息、实时、长程策略的复杂博弈,AlphaStar 通过强化学习自我对弈数百万局,学习到了接近人类大师级的宏观策略和微观操作。

影响

AlphaStar 证明强化学习能在极度复杂的不完全信息实时博弈中达到职业水平,是继 AlphaGo 后的又一里程碑。它展示了 AI 处理现实世界复杂决策问题的潜力,对机器人、自动驾驶等领域有启发意义。

深入了解
🕵️
20192019年12月
概念

DeepFake 检测挑战赛

Facebook、微软、AWS 等联合发起 DeepFake 检测挑战赛(DFDC),提供包含数十万段视频的大型数据集,推动自动识别 AI 换脸伪造内容的技术发展。随着生成式 AI 伪造能力增强,假视频、假新闻对民主选举和公众信任构成威胁,检测与鉴伪成为紧迫课题。该挑战赛吸引了全球研究者参与,催生了一批鉴伪算法和评测基准。

影响

该挑战赛标志着 AI 伪造与检测的"军备竞赛"正式开始,催生了一批鉴伪数据集和方法。它也将深度伪造的伦理与安全风险推上公共政策议程,为后来生成式 AI 治理奠定了早期基础。

深入了解
🌟
20202020年5月
模型

GPT-3 发布

OpenAI 发布 GPT-3,参数量达 1750 亿,比 GPT-2 大 100 倍。GPT-3 展现出惊人的少样本和零样本学习能力:无需微调,仅通过几个示例或指令即可完成翻译、写代码、写文章等多样任务,涌现出前所未有的通用能力。

影响

GPT-3 是大模型时代的真正起点,证明了 Scaling Law——模型规模、数据量和算力的指数增长能带来能力的质变。它催生了提示工程这一新范式,并引发了"大模型是否通向 AGI"的严肃讨论。

深入了解
🌫️
2020
模型

DDPM 扩散模型

Jonathan Ho 等人发表去噪扩散概率模型(DDPM),通过逐步加噪和反向去噪过程生成高质量图像。扩散模型在图像生成质量上超越 GAN,且训练更稳定、模式覆盖更全面,成为生成模型的新王者。

影响

DDPM 开启了扩散模型的统治时代,直接催生了 Stable Diffusion、DALL-E 2、Midjourney 等现象级应用。它将高质量图像生成的门槛大幅降低,是生成式 AI 爆发的技术基石之一。

深入了解
👁️
20202020年10月
突破

Vision Transformer (ViT)

Google 团队提出 Vision Transformer,将图像切分为固定大小的图块(patch)并作为 token 序列输入 Transformer 编码器,在 ImageNet 上达到甚至超越 CNN 的精度。ViT 证明了 Transformer 不仅适用于文本,也能在视觉领域成为通用架构,打破了 CNN 在视觉任务上的垄断地位。它摒弃了卷积的归纳偏置,依靠大规模数据即可学习到强大的视觉表示。

影响

ViT 开启了视觉领域的 Transformer 化浪潮,催生了 Swin Transformer、DETR 等一系列模型。它使多模态统一建模成为可能,是视觉-语言大模型的基础,推动计算机视觉从 CNN 时代迈向 Transformer 时代。

深入了解
🧬
20202020年11月
里程碑

AlphaFold 2 破解蛋白质折叠

DeepMind 的 AlphaFold 2 在蛋白质结构预测竞赛 CASP14 中取得革命性突破,预测精度接近实验测定水平。蛋白质三维结构预测困扰生物学界 50 年,AlphaFold 2 几乎解决了这一难题。

影响

AlphaFold 2 被认为是 AI 对科学最重要的贡献之一,DeepMind 随后开源了 2 亿种蛋白质结构数据库,覆盖几乎所有已知蛋白质。它加速了药物研发、疾病理解和合成生物学,是 AI for Science 的标杆。

深入了解
🎨
20212021年1月
模型

DALL-E 文本生成图像

OpenAI 发布 DALL-E,能根据文本描述生成创意图像。DALL-E 将 GPT 式自回归建模应用于图像 token,展示了文本到图像跨模态生成的可能性,能将"牛油果形状的扶手椅"等抽象描述具象化。

影响

DALL-E 开创了文本到图像生成的新赛道,让创意表达从专业设计技能变为自然语言描述。它启发了后续 DALL-E 2、Stable Diffusion 等更强大的模型,推动了生成式 AI 在创意领域的爆发。

深入了解
🔗
2021
模型

CLIP 多模态对齐

OpenAI 发布 CLIP(Contrastive Language-Image Pre-training),用 4 亿图文对进行对比学习,将图像和文本映射到统一的向量空间。CLIP 实现了零样本图像分类,并能作为其他模型的强大视觉编码器。

影响

CLIP 是多模态学习的里程碑,统一的图文表示空间使其成为无数视觉系统的 backbone。它支撑了 Stable Diffusion 的文本条件控制、零样本检测等应用,是连接语言与视觉的关键桥梁。

深入了解
💻
20212021年6月
工具

GitHub Copilot 发布

GitHub 与 OpenAI 合作推出 Copilot,基于 Codex 模型(GPT 的代码版本),能根据注释和上下文自动补全代码。Copilot 是大模型首个大规模商业化的生产力工具,改变了程序员的工作方式。

影响

Copilot 证明了大模型在实际工作中的生产力价值,让 AI 编程助手成为开发者标配。它推动了代码大模型的快速发展,也引发了关于版权、代码安全和程序员角色转变的讨论。

深入了解
🧭
20222022年1月
模型

InstructGPT 与 RLHF 训练

OpenAI 发表 InstructGPT 论文,系统阐述了基于人类反馈的强化学习(RLHF)三阶段训练流程:监督微调、奖励模型训练和 PPO 优化。相比原始 GPT-3,InstructGPT 在指令遵循和回答有用性上大幅提升,显著减少了不相关和有害输出。它正是同年晚些时候 ChatGPT 背后的技术雏形,让模型真正"听懂人话"。

影响

InstructGPT 是 ChatGPT 成功的直接技术基础,RLHF 从此成为大模型对齐的标准方法。它证明了将模型对齐到人类意图能带来巨大的体验提升,是 2022 年底生成式 AI 爆发的关键前奏。

深入了解
🌈
20222022年4月
模型

DALL-E 2 发布

OpenAI 发布 DALL-E 2,采用 CLIP 文本编码器与扩散模型结合,能根据文本生成高分辨率、风格多样的逼真图像。相比初代 DALL-E,其画面质量、语义一致性和细节表现均有质的飞跃,并支持图像编辑与变体生成。DALL-E 2 还能对真实照片进行文字指导的局部修改,展示了扩散模型强大的可控生成能力。

影响

DALL-E 2 将文本生成图像推向实用级别,与 Stable Diffusion、Midjourney 共同引爆了 AIGC 浪潮。它展示了扩散模型在创意生成上的巨大潜力,推动生成式 AI 进入大众视野。

深入了解
🖼️
20222022年8月
工具

Stable Diffusion 开源

Stability AI 发布 Stable Diffusion 并完全开源,这是首个能在消费级 GPU 上运行的高质量文生图模型。基于潜在扩散(Latent Diffusion)架构,结合 CLIP 文本编码器,用户可在本地生成图像。

影响

Stable Diffusion 的开源引爆了生成式 AI 的民主化浪潮,催生了无数衍生模型、插件和应用。它让图像生成从大公司专属变为人人可用,深刻改变了设计、插画、游戏等创意产业。

深入了解
🎙️
20222022年9月
工具

Whisper 开源语音识别

OpenAI 开源 Whisper 语音识别模型,基于 68 万小时多语言数据训练的 Encoder-Decoder Transformer,支持 99 种语言的转录与翻译。Whisper 在嘈杂环境、口音和多语种混合场景下表现稳健,接近商用系统水平且完全免费。它还支持词级时间戳和语种自动检测,成为字幕生成和会议纪要等场景的首选工具。

影响

Whisper 大幅降低了高质量语音识别的门槛,被广泛集成到字幕生成、会议纪要、语音助手等应用中。它推动了多语种 ASR 技术的普及,是开源 AI 工具链的重要组成。

深入了解
💬
20222022年11月30日
里程碑

ChatGPT 发布

OpenAI 发布 ChatGPT,基于 GPT-3.5 并经过 RLHF 对齐训练。ChatGPT 能进行流畅的多轮对话、回答问题、写代码、创作文本,表现出前所未有的通用语言理解和生成能力。发布两个月用户突破一亿,成为史上增长最快的应用。

影响

ChatGPT 是 AI 历史上具有分水岭意义的事件,将大语言模型从实验室推向大众,引发了全球性的 AI 狂热。它重新定义了人机交互方式,迫使教育、搜索、办公等各行业重新思考未来,开启了生成式 AI 时代。

深入了解
🧠
20232023年3月
模型

GPT-4 发布

OpenAI 发布 GPT-4,在语言理解、推理、代码和创造力上大幅超越 GPT-3.5,并在律师资格考试等人类专业测试中达到顶尖水平。GPT-4 首次具备多模态能力(GPT-4V),能理解图像内容,标志着大模型向通用智能迈出关键一步。

影响

GPT-4 确立了大模型能力的新基准,其多模态和推理能力进一步逼近通用人工智能。它被广泛应用于企业生产力、教育辅助和专业服务,推动了 AI 商业化的全面加速,也加剧了关于 AI 风险与监管的全球讨论。

深入了解
🦙
20232023年2月
模型

LLaMA 开源大模型

Meta 发布 LLaMA 系列开源大模型(7B-65B 参数),虽未开放商用但权重泄露后迅速被社区微调和优化。LLaMA 证明了开源模型可以接近闭源模型水平,催生了 Alpaca、Vicuna 等大量衍生模型,开启了开源大模型生态。

影响

LLaMA 改变了闭源模型垄断的格局,让研究者和中小团队也能训练和部署大模型。它催生了 LLaMA 2、Llama 3 等商用开源模型,推动了模型微调、量化和部署技术的繁荣,降低了 AI 创新门槛。

深入了解
🎨
20232023年3月
工具

Midjourney V5 引领 AI 绘画

Midjourney 发布 V5 版本,生成图像的写实度、细节和构图达到专业摄影水平。Midjourney 通过 Discord 交互和持续迭代,成为最受欢迎的 AI 绘画工具之一,广泛应用于商业设计、概念艺术和娱乐产业。

影响

Midjourney 证明了生成式 AI 在创意产业的实用价值,专业设计师开始将其纳入工作流。它也引发了关于版权、艺术原创性和设计师职业前景的激烈争论,加速了创意行业的范式转变。

深入了解
🛡️
20232023年3月
模型

Claude 发布

Anthropic 发布 Claude 对话模型,主打安全性和有用性的平衡。Claude 采用宪法 AI(Constitutional AI)方法进行对齐,减少有害输出。Claude 在长文本理解和写作上表现突出,成为 GPT 的主要竞争者。

影响

Claude 为大模型对齐提供了不同于 RLHF 的新思路,宪法 AI 通过自我批评和改进减少对人工标注的依赖。它打破了 OpenAI 的垄断,推动了模型多样性和安全对齐研究的发展。

深入了解
🎯
2023
概念

RLHF 对齐范式普及

随着 ChatGPT 的成功,基于人类反馈的强化学习(RLHF)成为大模型对齐的标准范式。研究者深入探索奖励模型设计、PPO 优化和 KL 约束,同时提出 DPO 等简化方案,对齐工程成为大模型训练的核心环节。

影响

RLHF 的普及让"对齐"从一个研究问题变为工程必需品,催生了完整的对齐技术栈。DPO 等新方法降低了 RLHF 的工程复杂度,使中小团队也能进行高质量对齐,推动了大模型生态的繁荣。

深入了解
🔧
20232023年5月
工具

LoRA/QLoRA 高效微调

微软等团队提出 QLoRA(量化低秩适配),通过 4-bit 量化与低秩适配器,使在单张消费级 GPU 上微调百亿参数大模型成为可能。LoRA 及其变体仅训练极少量参数即可达到接近全量微调的效果,大幅降低了显存和算力需求。这让中小团队和个人开发者也能定制大模型,掀起社区微调的浪潮。

影响

QLoRA 引发了大模型微调的民主化浪潮,催生了海量社区微调模型。它使垂直领域定制大模型的成本从数十万美元降至数百美元,推动了开源大模型生态的繁荣。

深入了解
⚖️
20232023年5月
突破

DPO 直接偏好优化

斯坦福团队提出直接偏好优化(DPO),将 RLHF 的奖励建模与强化学习简化为单一的分类损失,无需训练奖励模型或使用 PPO。DPO 在数学上等价于 RLHF 的优化目标,但训练更稳定、更易实现,调参需求大幅降低。它使对齐训练从复杂的强化学习工程回归到标准的监督学习范式。

影响

DPO 让对齐训练从复杂的强化学习工程简化为标准的监督学习,被 Llama 3、Mistral 等主流模型广泛采用。它与 RLHF 并列成为大模型对齐的两大主流方法,大幅降低了对齐的技术门槛。

深入了解
🦙
20232023年7月
模型

LLaMA 2 商用开源发布

Meta 与微软联合发布 LLaMA 2 系列(7B、13B、70B),首次开放商用许可,并经过 RLHF 对齐优化可直接用于对话场景。LLaMA 2 在多项基准上接近当时的闭源模型,配合宽松许可迅速成为开源社区最受欢迎的基座模型。它的发布标志着开源大模型从研究走向产业落地的关键一步。

影响

LLaMA 2 推动了企业级开源大模型的普及,让公司在私有环境中部署可控的大模型成为现实。它催生了庞大的微调、量化和部署生态,奠定了开源大模型与闭源模型分庭抗礼的格局。

深入了解
🔎
2023
概念

RAG 检索增强生成成为标配

检索增强生成(RAG)在 2023 年成为大模型落地的事实标准:将外部知识库检索与生成结合,让模型基于最新或私有文档回答问题,缓解幻觉问题。LangChain、LlamaIndex 等框架的成熟使 RAG 管道搭建变得便捷,企业知识库问答等应用快速普及。RAG 让大模型无需重新训练即可接入领域知识,成为企业部署最实用的方案。

影响

RAG 让大模型无需重新训练即可接入领域知识,成为企业部署大模型最实用的方案。它催生了向量数据库、Embedding 模型等新产业,是连接大模型与现实世界知识的关键范式。

深入了解
♊
20232023年12月
模型

Gemini 多模态大模型发布

Google 发布 Gemini 系列(Ultra、Pro、Nano),这是首个从零训练的原生多模态大模型,能同时处理文本、图像、音频和视频。Gemini 深度集成到 Android、Pixel 和谷歌办公全家桶,标志谷歌全面加入大模型竞争。其中 Nano 版本专为端侧设备设计,开启了多模态模型本地部署的探索。

影响

Gemini 打破了 OpenAI 在大模型领域的独大局面,推动多模态成为大模型的标配能力。它的原生多模态设计为端侧部署和实时交互开辟了新路径,加剧了科技巨头间的 AI 军备竞赛。

深入了解
🎬
20242024年2月
模型

Sora 视频生成模型

OpenAI 发布 Sora,能根据文本生成长达 60 秒的高质量视频,具备物理一致性、多镜头切换和复杂场景理解能力。Sora 基于扩散 Transformer(DiT)架构,将视频生成推向新高度,被视为"世界模型"的雏形。

影响

Sora 展示了视频生成的巨大潜力,模糊了 AI 生成与现实的边界。它引发了对世界模型、物理模拟和 AI 伦理的深入讨论,预示了影视、广告、游戏等行业将被深刻重塑,也加剧了对深度伪造的担忧。

深入了解
🦙
20242024年4月
模型

Llama 3 开源

Meta 发布 Llama 3 系列,包括 8B、70B 和 400B 参数版本,性能接近 GPT-4。Llama 3 采用了 15T token 的大规模预训练数据和改进的架构,并以宽松的商用许可开源,进一步推动了开源大模型生态。

影响

Llama 3 证明了开源模型可以达到接近顶级闭源模型的能力,改变了"开源追不上闭源"的预期。它被广泛用作基座模型进行微调和部署,成为企业私有化部署大模型的首选,推动了 AI 的普惠化。

深入了解
🧪
20242024年3月
模型

Claude 3 超越 GPT-4

Anthropic 发布 Claude 3 系列(Haiku、Sonnet、Opus),其中 Opus 在多项基准上超越 GPT-4。Claude 3 在长上下文(20 万 token)、推理和编码能力上表现突出,并显著减少了拒绝回答的过度保守问题。

影响

Claude 3 标志着 GPT-4 的霸主地位被打破,大模型竞争进入多强并立阶段。长上下文能力的突破为文档分析、代码理解等应用开辟了新空间,也推动了行业在上下文长度上的军备竞赛。

深入了解
🧩
20242024年9月
模型

OpenAI o1 推理模型

OpenAI 发布 o1 模型(代号 Strawberry),首次将"推理时计算"作为核心能力。o1 在回答前进行内部思维链推理,在数学、编程和科学推理基准上大幅超越 GPT-4o,开启了"慢思考"大模型的新范式。

影响

o1 证明了在推理阶段投入更多计算能显著提升复杂推理能力,这与传统的"训练时扩展"形成互补。它重新定义了大模型能力提升的路径,引发了推理时计算扩展(test-time compute scaling)的研究热潮。

深入了解
📏
20242024年2月
模型

Gemini 1.5 百万级长上下文

Google 发布 Gemini 1.5 Pro,采用混合专家(MoE)架构,上下文窗口突破至 100 万 token,后续扩展到 200 万。它能一次性消化整本书、数小时长视频或大型代码库,并在超长输入中保持精准的检索能力。这突破了此前的"记忆瓶颈",让大模型能处理此前无法企及的长文档任务。

影响

百万级上下文突破了"记忆瓶颈",让大模型能处理此前无法企及的长文档任务。它引发了长上下文的军备竞赛,推动了"大海捞针"等长文本评测方法的发展,重塑了文档分析与代码理解的应用形态。

深入了解
🎧
20242024年5月
模型

GPT-4o 原生多模态实时交互

OpenAI 发布 GPT-4o("o"代表 omni),实现文本、视觉和音频的端到端原生多模态,语音对话延迟低至 232 毫秒,达到人类对话水平。GPT-4o 能感知语音情感、实时分析摄像头画面,交互体验前所未有地自然。它将多模态从"轮流问答"推进到"实时同传"的新阶段。

影响

GPT-4o 将实时多模态交互推向新高度,让 AI 语音助手从生硬的问答进化为流畅对话。它开创了实时视觉与语音融合的新交互范式,对教育陪伴、客服和无障碍应用影响深远。

深入了解
🛠️
20242024年6月
模型

Claude 3.5 Sonnet 编程突破

Anthropic 发布 Claude 3.5 Sonnet,在编码、推理和视觉理解上全面领先同代模型,并推出 Artifacts 功能实时渲染代码、文档和图表等产物。它在 SWE-bench 等编程基准上大幅超越 GPT-4o,成为开发者最青睐的编码助手之一。Claude 3.5 还以更小的参数实现了更强性能,挑战了"规模至上"的传统认知。

影响

Claude 3.5 Sonnet 让 AI 编程助手的实用性迈上新台阶,Artifacts 交互模式被广泛模仿。它推动了 Cursor 等智能编程工具的爆发,加速了软件开发范式的变革。

深入了解
🔀
2024
概念

MoE 混合专家架构主流化

以 Mistral 的 Mixtral 8x7B 为代表,混合专家(MoE)架构在 2024 年走向主流:通过路由机制仅激活部分专家子网络,以更低的推理成本实现接近稠密大模型的效果。DeepSeek-MoE、Grok 等纷纷采用 MoE,稀疏激活成为高效大模型的主流选择。MoE 让同等推理算力下能支撑更大参数量,是性能与成本平衡的关键技术。

影响

MoE 让大模型在性能与成本间取得更优平衡,使同等推理算力下能支撑更大参数量。它推动了高效推理的研究,也为开源模型以较低成本对标闭源模型提供了关键路径。

深入了解
📱
2024
概念

小语言模型崛起

微软 Phi-3、谷歌 Gemma、Meta Llama 3 8B 等小参数模型(3B-8B)在 2024 年异军突起,凭借高质量合成数据训练在多项基准上逼近早期大模型。小模型可在手机和边缘设备本地运行,兼顾隐私、延迟与成本。它们打破了"越大越好"的单一认知,开辟了端侧 AI 部署的新赛道。

影响

小模型的崛起打破了"越大越好"的单一认知,开辟了端侧 AI 部署的新赛道。它让 AI 能力下沉到手机、PC 和物联网设备,推动苹果 Intelligence 等端侧 AI 应用的落地,重塑了模型部署格局。

深入了解
🚄
2024
工具

推理优化与高效部署成熟

vLLM、TensorRT-LLM、PagedAttention 等推理优化技术在 2024 年趋于成熟,配合 KV 缓存复用、连续批处理和 4-bit/8-bit 量化,将大模型推理吞吐量提升数倍至数十倍。这些工具使大规模在线服务的高并发部署成为可能,显著降低了每 token 的服务成本。推理优化与专用硬件的结合,让生成式 AI 的商业化真正跑通。

影响

推理优化技术是生成式 AI 商业化的幕后基石,让大模型 API 价格在两年内下降超 90%。它使中小创业公司也能负担高并发推理,推动了 AI 应用的百花齐放。

深入了解
🐋
20252025年1月
模型

DeepSeek-R1 推理模型

DeepSeek 发布 R1 推理模型,通过纯强化学习(无需 SFT 冷启动)训练出强大的推理能力,在数学和编码基准上对标 o1。R1 完全开源权重和训练方法,以极低成本实现了顶级推理性能,震动全球 AI 界。

影响

DeepSeek-R1 证明了开源团队也能实现顶级推理能力,打破了推理模型的技术垄断。其高效的训练方法和开源策略大幅降低了推理模型门槛,引发了关于 AI 算力需求和大模型竞争格局的重新评估。

深入了解
⏳
2025
概念

推理时计算扩展范式确立

在 o1 和 R1 的推动下,"推理时计算扩展"成为大模型能力提升的新范式。通过在推理阶段生成更长的思维链、进行多次采样投票和树搜索,模型在不增加参数的情况下显著提升复杂任务表现,与训练时扩展形成双轮驱动。

影响

这一范式改变了对大模型 Scaling Law 的单一理解,证明算力不仅在训练时重要,推理时的合理分配同样关键。它为在有限算力下提升模型智能提供了新路径,推动了推理优化和测试时技术的快速发展。

深入了解
🤖
2025
概念

AI Agent 自主智能体爆发

大模型驱动的自主智能体(Agent)在 2025 年迎来爆发,能够自主规划、使用工具、浏览网页、编写代码并完成复杂的多步骤任务。Anthropic 的 Computer Use、OpenAI 的 Operator 等让 AI 能直接操作电脑界面,标志着从"对话助手"到"数字员工"的转变。

影响

AI Agent 代表了大模型从被动回答向主动执行的范式跃迁,有望重塑软件交互和工作流自动化。它也带来了新的安全挑战——自主执行的 AI 需要更严格的权限控制和可解释性,推动了 Agent 安全治理的紧迫讨论。

深入了解
🔮
2025
概念

多模态大模型成为标配

GPT-4o、Gemini、Claude 等主流大模型全面支持原生多模态——文本、图像、音频和视频的统一输入输出。实时语音对话、视觉理解和跨模态生成成为基础能力,多模态不再是附加功能而是模型核心。

影响

原生多模态让人机交互更接近人类自然沟通方式,实时语音和视觉理解开辟了教育、陪伴、无障碍等新场景。它也推动了对齐研究从纯文本扩展到多模态安全,是通向通用人工智能的重要一步。

深入了解
🕊️
2025
里程碑

开源模型全面追平闭源

DeepSeek V3/R1、Qwen 2.5、Llama 3.1 405B 等开源模型在 2025 年多项基准上追平甚至超越 GPT-4o 等顶级闭源模型。以 DeepSeek 为代表的中国开源团队以极低训练成本实现顶尖性能,引发全球对 AI 算力需求与竞争格局的重新评估。开源追平闭源标志着大模型能力的民主化,企业不再被单一供应商锁定。

影响

开源追平闭源标志着大模型能力的民主化,企业不再被单一供应商锁定。它重塑了全球 AI 竞争格局,推动了模型商品化趋势,也促使闭源厂商转向推理能力等新壁垒。

深入了解
📲
2025
工具

端侧大模型与边缘 AI 普及

苹果 Apple Intelligence、高通 AI Engine 等推动大模型在手机、PC 和汽车上本地运行,结合云端大模型形成"端云协同"架构。端侧模型保障了隐私和低延迟,使 AI 助手能深度集成到操作系统并实时感知用户上下文。它让 AI 从云端走向设备,重塑了个人计算体验和操作系统交互范式。

影响

端侧 AI 让大模型从云端走向设备,重塑了个人计算体验和操作系统交互范式。它推动了 NPU 算力的军备竞赛,也引发了关于模型蒸馏、隐私保护与端侧安全的新一轮技术竞争。

深入了解
🧱
2025
工具

AI Agent 框架与工具链成熟

LangGraph、AutoGen、CrewAI 等 Agent 编排框架在 2025 年走向成熟,Anthropic 推出 MCP(模型上下文协议)标准化工具与数据接入。OpenAI 的函数调用与计算机操作能力持续增强,开发者能像搭积木般构建多步骤、多智能体协作的复杂工作流。成熟的框架与协议让 AI Agent 从概念走向工程落地,催生了自动化数据分析、客服、研发等"数字员工"应用。

影响

成熟的框架与协议让 AI Agent 从概念走向工程落地,催生了自动化数据分析、客服、研发等"数字员工"应用。它降低了构建智能体的门槛,推动 Agent 成为继大模型之后的新一轮创新焦点。

深入了解
🦾
2026
概念

具身智能走向实用

大模型驱动的具身智能在人形机器人和自动驾驶领域取得实质性进展。视觉-语言-动作模型(VLA)让机器人能理解自然语言指令并执行复杂操作,端到端自动驾驶在更多城市落地。AI 开始从数字世界走向物理世界。

影响

具身智能的实用化意味着 AI 的影响从信息处理扩展到物理操作,将深刻改变制造业、物流、家务和出行。它也提出了 Sim-to-Real、安全冗余和物理对齐等全新挑战,是通向通用人工智能最前沿也是最具争议的方向。

深入了解
🌌
2026
概念

AGI 路径之争深化

随着大模型、推理模型、Agent 和具身智能的交汇,关于通用人工智能(AGI)的实现路径和定义标准之争愈发激烈。一方主张继续扩大模型规模和数据,另一方强调推理、具身和世界模型的不可替代性。AGI 不再是遥远的科幻,而是工程上的严肃目标。

影响

AGI 路径之争实质是对智能本质的不同理解,它决定了数千亿美元算力投资的方向。无论哪条路径胜出,AI 能力的持续提升正在重塑经济结构、就业形态和全球权力格局,安全治理和惠益分配成为人类共同面对的世纪议题。

深入了解