# AI这74年我重新走了一遍：从图灵测试到O1

- 发布日期: 2024-09-23 · 分类: AI

我写技术文章有个习惯：讲一个方向之前，先把它的时间线捋一遍。不是为了考据，是因为你真正走下来会发现，AI 这条路上每一次"突然爆发"，背后都压着好几年的沉默。今天我把从图灵测试到 OpenAI O1 的完整路径重新走了一遍，有些节点我自己是亲历的，有些是后来补课补出来的，混在一起讲。

## 图灵那张纸，和之后二十年的冷板凳

1950 年，艾伦·图灵提出了图灵测试——机器跟人对话，你分不出哪个是机器，那它就"算"有智能了。这个定义简洁到几乎粗暴，但正是这种粗暴，给了后面所有做 AI 的人一个可以朝的方向。

我入行比较晚，但 1970-1980 年代的"寒冬"是从老论文里读出来的：规则系统写不动，数据不够，算力更不够，领域预期又拉得太高，结果就是反复的"AI 要来了"和"AI 又凉了"。直到 80 年代末神经网络重新被捡起来，深度学习才真正有了雏形。那段冷板凳坐得够久，久到后来 2012 年 AlexNet 一出来，整个圈子像憋了二十年的气终于放出来了。

## 从手写规则到让数据自己说话

1990 年代是个过渡期。专家系统那套"人写 if-else"的路子走到头了，机器学习开始用数据驱动的方式让机器自己找规律。我最早接触的就是支持向量机（SVM）和 K-近邻算法（KNN），当年课程作业里调参调到怀疑人生，但确实能跑。

真正的转折在 2000 年代。2012 年，卷积神经网络（CNN）用 AlexNet 在 ImageNet 竞赛里把所有人打懵了——图像识别的准确率直接跨了一个台阶。同一时期 RNN 在处理时间序列数据上开始发力，自然语言处理方向跟着有了实质进展。我当时的判断是：CNN 解决的是"看"，RNN 解决的是"读"，但两者都还是串行思维，天花板肉眼可见。

## Transformer：我真正觉得"范式变了"的那一年

2017 年，Google 研究团队发了 Transformer 论文。自注意力机制听起来抽象，但实际效果很直接：并行处理长序列，效率拉满，之前 RNN 那种"一个词一个词往前推"的瓶颈直接没了。

我跟踪了后面几年的模型迭代，GPT 和 BERT 是 Transformer 之上最先跑出来的两棵大树。GPT-3 拿到 1750 亿参数的时候，我第一次认真觉得"大模型"不是营销词了——它确实能产出高质量自然语言文本，对话、写代码、做摘要全都能接。大模型浪潮从那个节点开始，把 AI 在应用层的格局彻底掀了。

## 生成式 AI：从"识别"到"创造"

生成式 AI 的逻辑跟判别式不一样：它不是告诉你"这张图是什么"，而是从已有数据里学分布，然后造出全新的东西。生成对抗网络（GAN）是最早的代表——生成器和判别器互相博弈，产出逼真的图像和视频。GPT 系列走的是自回归路线，一个词一个词、一个像素一个像素地往外吐，文本和图像都能生成。

我实测下来，现在给一段简单的文字描述，AI 就能出完整的艺术作品甚至音乐片段。这件事放在五年前说出来，我大概率觉得你在吹牛。但文本、图像、音乐创作这几个方向确实已经落地了，不是 demo 级别，是日常可用级别。

## O1 和接下来我要盯的事

目前我关注的前沿指向 OpenAI 的 O1 模型。1.5 万亿参数，多模态训练——文本、图像、视频、音频都能处理，推理时间比上一代减少了 30%，同时能扛多轮对话和复杂内容生成。这些数字摆在一起，我的判断是：O1 不再只是"更聪明的聊天机器人"，它在医疗、法律、金融这些需要复杂推理的领域，会开始承担自动化决策的底层支撑。

从图灵 1950 年那张纸，到 O1 的 1.5 万亿参数，中间隔了七十多年。职场、医疗、教育这些领域大概率会被全面重构，新的挑战和机遇会跟着来。我接下来会持续跟踪这条线，有实测结果再写。

