AI 行业知识科普报告

AI 行业知识科普报告
从零基础到能看懂产业分析

一份面向分析师和决策者的 AI 产业入门指南。覆盖 240+ 核心概念、全产业链结构、50+ 全球关键玩家、六大商业模式。每个概念标注学习深度,帮你分配精力——知道该深挖什么,什么只是听过就行。

240+
核心概念
4
知识章节
50+
关键玩家
6
商业模式
浅层认知 听一遍理解即可,做产业聊天时不卡壳
中层理解 需要配图、流程图来辅助消化 · 已内置架构图
深层体系 独立学科/方法论,需开分支系统学习
报告章节导航
四个章节从基础到进阶。建议按顺序阅读效果最好,也可以直接跳转到你感兴趣的章节。
AI / ML / DL —— 最容易搞混的三个词
建立 AI 认知的最底层框架。每个概念标注了学习深度——浅层 中层 深层

浅层必知人工智能(AI)

Artificial Intelligence,最宽泛的概念。凡是让机器模拟人类智能的技术都叫 AI:语音识别、下棋、自动驾驶,都算。AI 是一个目标,不是一项具体技术。

关系:AI 包含 ML,ML 包含 DL

深层必知机器学习(ML)

Machine Learning,AI 的子集。机器从数据中自动学习规律,而不是靠人一条条写规则。今天的 AI 爆发,本质上就是机器学习的胜利。这是门完整学科,吴恩达的 Coursera 课程是经典入门。

类比:给机器看 10 万张猫的照片,它自己学会"什么是猫"

深层必知深度学习(DL)

Deep Learning,ML 的子集。用多层神经网络处理数据。"深度"就是层数多。ChatGPT、Midjourney、Sora,底层全是深度学习。独立学科,推荐李沐《动手学深度学习》。

深度学习 = 海量算力 + 海量数据 + 深层网络

中层神经网络

深度学习的核心架构。由大量互相连接的"神经元"节点组成,每个节点接收输入、做计算、输出结果。参数就是连接权重——参数越多,模型越"聪明"。下方架构图直观展示层级结构。

类比:一个神经元是一个微小开关,万亿个开关组成能理解语言的系统
图解:AI / ML / DL 包含关系 & 神经网络层级结构

左图:三层同心圆展示包含关系。右图:神经网络的"输入 → 隐藏层 → 输出"数据流动方式。

DL
ML
AI
AI 包含 ML,ML 包含 DL
输入层

文本
图像
音频

隐藏层 1

提取边缘
基础特征

隐藏层 2

组合形状
中层特征

隐藏层 N

抽象语义
高层特征

输出层

分类
预测
生成

"深度"= 隐藏层数量多,每层提取更高维特征
关键洞察:记住这个包含关系就够了

AI 是森林,ML 是长得最快的树种,DL 是最高最壮的那棵树。ChatGPT、文心一言、Sora,都属于深度学习分支。ML 和 DL 标注为"深层体系"——它们是独立学科,你现在不需要啃,但知道是需要系统学习的大领域就够了。

大语言模型(LLM)—— 本轮 AI 爆发的发动机
以下概念在产业分析中高频出现,掌握它们才能看懂研报和新闻。

中层必知大语言模型(LLM)

Large Language Model,用海量文本训练出来的超大规模神经网络。参数动辄数千亿,能展现出推理、创作、编程等"涌现"能力。ChatGPT 背后的 GPT 系列就是 LLM。下方有 LLM 训练全流程图。

核心规律:参数越多 → 能力越强 → 成本越高

中层必知Transformer 架构

2017 年 Google 提出,几乎所有现代大语言模型的基石。核心创新是自注意力机制——让模型理解词与词之间的上下文关系。GPT 里的"T"就是 Transformer。下方有架构图解。

BERT、GPT、Llama,全基于 Transformer

浅层GPT 系列模型

OpenAI 推出的大语言模型系列。GPT-1(2018) → GPT-2 → GPT-3(2020,1750亿参数) → GPT-3.5(ChatGPT) → GPT-4(2023) → GPT-4o(2024,多模态)。ChatGPT 是产品名,GPT 是模型名,别搞混。

中层必知多模态模型

能同时处理文字、图片、音频、视频的模型。GPT-4o 可以看图回答问题,Sora 能根据文字生成视频。从纯文本到多模态是一次质变。下方有融合架构图解。

浅层参数(Parameters)

衡量模型规模的指标。GPT-3:1750亿,GPT-4:估约1.8万亿。参数越多 = 模型越大 = 能力越强 = 训练越贵。但 DeepSeek 证明了架构创新同样重要。

训练一个 GPT-4 级别的模型,成本约 1-3 亿美元

浅层词元(Token)

大模型处理文本的最小单位。也是 API 调用的计费单位。1 个中文字 ≈ 1.5-2 个 token;1 个英文单词 ≈ 1-2 个 token。1000 token ≈ 750 英文词 ≈ 400-500 中文字。

浅层上下文窗口(Context Window)

模型一次能"记住"的最大文本量。GPT-4 Turbo:128K(≈ 一本中篇小说)。Gemini 1.5 Pro:号称 100 万 token。窗口越长,能处理的文档越大,但成本也越高。

中层涌现(Emergence)

当模型参数超过某个阈值后,突然展现出训练时没有明确教的"理解力"——推理、编程、翻译。推动科技巨头疯狂堆参数,科学界至今没完全解释清楚。

图解:Transformer 核心架构

GPT 只用了右半部分(Decoder),BERT 只用了左半部分(Encoder)。核心创新"自注意力机制"让每个词能直接关注到句子中所有其他词。

Encoder(编码器)— 理解任务
输入文本
"我 爱 AI"
词嵌入 + 位置编码
词 → 向量 + 位置信息
多头自注意力
每个词关注所有词
前馈网络
逐位置变换
上下文表示
词与词的关联矩阵
Decoder(解码器)— 生成任务
已生成文本
"AI 是"
掩码自注意力
只看前面的词
交叉注意力
关注 Encoder 输出
前馈网络
逐位置变换
预测下一个词
"人工" ← 输出
注意力机制 理解结果 生成输出
图解:多模态模型 — 不同信号如何融合

各模态先经各自的编码器处理成统一向量空间,再由融合层做跨模态理解,最后输出。

文本编码器
Transformer
文本向量
图像编码器
ViT / CNN
图像向量
音频编码器
Whisper
音频向量
统一向量空间
跨模态融合层
交叉注意力
联合表征
多模态输出
文本/图像/语音
产业关键认知

大语言模型不是"聊天程序"——它是一种新的基础能力平台,相当于工业革命里的电。它提供"通用智能"作为基础设施。这是理解整个 AI 产业商业逻辑的出发点。

训练与推理 —— 从"学会"到"会用"
训练是一次性巨额投入,推理是持续性运营成本。搞懂两者的区别,才能分析 AI 公司的成本结构。

中层必知预训练(Pre-training)

第一阶段。用万亿级 token 数据教模型"学会说话"。需要数千张 GPU 连续跑几个月,成本从几千万到几亿美元。下方有完整训练流程图。

深层必知微调(Fine-tuning)

在预训练模型基础上,用特定领域数据(几万条就够了)做二次训练。成本约是预训练的万分之一。大部分企业 AI 应用用的都是微调。预训练造通才,微调造专才。微调是一个方法体系:SFT、LoRA、QLoRA、RLHF、DPO。

浅层必知推理(Inference)

训练好的模型回答用户问题的过程。单次推理成本低到几分钱,但每天百万次调用累积下来,推理优化成为商业化的核心命题。

中层RLHF(人类反馈强化学习)

让人类对模型输出打分,模型据此调整行为。ChatGPT 之所以回答"像人"而不是胡说八道,靠的就是 RLHF。也是 AI 安全对齐的最后一道关。下方有 RLHF 流程图解。

中层量化(Quantization)

把参数精度压缩,减小模型体积和推理成本。让大模型能在手机上跑的关键技术。下方有精度对比表,一目了然。

浅层GPU(图形处理器)

原本用于游戏画面渲染,因为超强的并行计算能力成为 AI 训练的事实标准。英伟达(NVIDIA)占据全球 AI 训练芯片约 80% 市场。GPU 就是 AI 产业的"石油"。

图解:LLM 训练全流程(从数据到可用模型)

大模型诞生要经历三大阶段:海量无标注数据上的预训练(最贵)→ 有标注指令数据上的 SFT(较便宜)→ 人类偏好数据上的 RLHF 对齐(精细调教)。

原始数据
网页/书籍/代码
数万亿Token
数据清洗
去重/过滤
质量筛选
预训练
数千GPU·数月
成本: $$$$$
基座模型
通才·会续写
但不会对话
指令数据
数万条QA对
人工标注
SFT 监督微调
数GPU·数小时
成本: $$
指令模型
会遵循指令
但仍可能胡说
偏好数据
人类对回答打分
好坏对比
RLHF 对齐
奖励模型+PPO
成本: $$
Chat模型
安全·友好
像人一样说话
训练阶段 产出物 最终模型
图解:RLHF — 人类反馈强化学习闭环

SFT 模型生成多个回答 → 人类标注员打分排序 → 训练奖励模型学会"判断好坏" → 用 PPO 算法更新主模型,反复循环直到模型输出符合人类偏好。

SFT模型
生成多个回答
回答A/B/C
同一问题
不同回答
人类标注员
打分排序
A > B > C
训练奖励模型
学会预测
人类偏好
↑ 奖励信号反馈,用 PPO 算法更新模型参数 ↓
奖励模型评分
给新回答打分
PPO 更新模型
朝高分方向
调整参数
新SFT模型
继续生成
进入下一轮
循环迭代
图解:量化精度对比 — FP16 → INT8 → INT4

精度下降带来体积和速度的显著优化。FP16 是训练标配,INT8/INT4 是推理部署常用精度。

FP16(半精度浮点)
位数16 bit
模型体积100%
推理速度基准
精度损失
显存占用
适用场景训练 / 高精度推理
INT8(8位整数量化)
位数8 bit
模型体积~50%
推理速度1.5-2x
精度损失<1%
显存占用
适用场景服务器推理部署
INT4(4位整数量化)
位数4 bit
模型体积~25%
推理速度2-4x
精度损失1-3%
显存占用
适用场景端侧/手机/嵌入式
RAG 与智能体(Agent)—— 让大模型真正干活
大模型只是"大脑",RAG 和 Agent 是给大脑装上"手"和"外部记忆"。这是 AI 落地的关键技术。

中层必知RAG(检索增强生成)

Retrieval-Augmented Generation。回答前先检索外部知识库,再把找到的内容作为"参考资料"喂给模型,模型据此生成答案。下方有 RAG 架构流程图。

解决两大痛点:模型知识是"冻结"在训练日期的;大模型会产生幻觉编造事实

中层必知智能体(Agent)

AI Agent,能自主观察、规划、执行任务的 AI 系统。不只是聊天——它能调用工具(搜索、计算、发邮件)、分步规划、反思纠错。下方有 Agent 架构图解。

比喻:LLM 是大脑,Agent 是完整的人——有记忆、能用工具、会做计划

浅层必知提示词(Prompt)

给大模型的输入指令。好的 Prompt 能让模型输出质量提升数倍。提示工程(Prompt Engineering) 是当下的热门技能,设计让模型乖乖听话的话术。

基本原则:角色扮演 + 明确任务 + 格式要求 + 示例引导

中层必知向量数据库(Vector DB)

RAG 的核心基础设施。把文本变成数学向量,做"语义相似度搜索"——不是关键词匹配,而是理解意思。下方 RAG 流程图中能看到它的位置。

中层函数调用(Function Calling)

让大模型按预定格式输出"想调用什么工具、传什么参数",外部程序执行后把结果返回。这是 Agent 能上网查资料、调数据库、控制软件的关键桥梁。

浅层幻觉(Hallucination)

大模型一本正经地胡说八道。编造人名、数据、论文——看起来像真的但全是凭空生成的。RAG 是目前最有效的缓解方案:用检索到的真实文档约束模型回答。

浅层嵌入(Embedding)

把文字/图片/声音变成一串数字(向量),语义相近的内容向量也相近。RAG 的搜索不是关键词匹配,而是语义接近度计算。

中层LangChain / LlamaIndex

最流行的两个 LLM 应用开发框架。LangChain 侧重链式调用和 Agent 编排,LlamaIndex 侧重数据索引和检索。做 AI 应用开发绕不开这两个。

图解:RAG — 检索增强生成完整流程

离线阶段(上半):文档切块 → 向量化 → 存入向量数据库。在线阶段(下半):用户提问 → 向量检索 → 拼接增强 Prompt → LLM 生成答案。

离线建库阶段(一次性)
文档库
PDF/网页/数据库
企业内部知识
文本切块
Chunking
按语义切分段落
Embedding
向量化
文本 → 向量
向量数据库
存为索引
支持语义搜索
在线查询阶段(每次调用)
用户提问
"公司Q3
营收多少?"
Embedding 查询
问题向量化
向量检索
语义相似度
Top-K 召回
拼接 Prompt
问题 + 检索到的
上下文片段
LLM 生成答案
基于上下文
不瞎编
数据转换/Embedding 向量存储/检索 用户交互/生成
图解:AI Agent — 自主智能体四大模块

Agent = LLM 大脑 + 工具调用 + 记忆系统 + 规划能力。四个模块协作让 Agent 能自主完成复杂任务。

LLM 大脑
推理与决策引擎
GPT-4 / Claude /
文心 / DeepSeek
工具层
搜索 · 计算器
数据库 · API
代码执行器
记忆层
短期 · 对话上下文
长期 · 用户偏好
共享 · 跨会话知识
规划层
任务分解 · 子目标
反思纠错
ReAct / CoT
用户指令
规划分解
拆成步骤
调用工具
执行子任务
反思评估
结果是否正确
输出/重试
典型工作流:观察 → 思考 → 行动 → 观察 → ... → 完成(ReAct 模式)
重要区分

RAG 是给模型外接一个知识库,让模型能回答训练数据之外的问题。Agent 是给模型一个完整的行动框架——能使用工具、做计划、自我纠错。两者经常结合使用:Agent 在需要查资料时调用 RAG。

高频术语速查(240+词)— 看懂 AI 圈在聊什么
按二十一大类分组排列,阅读和分析 AI 相关材料时当作词典随时查阅。每个词标注学习深度。
Jamba
(Jamba (SSM+Transformer混合))
AI21 Labs 推出的 Mamba 状态空间模型+Transformer 混合架构,长上下文处理效率极高,140K 上下文窗口
Phi 系列
(Phi (Microsoft))
微软小参数高性能模型系列(Phi-1/2/3/4),用"教科书级数据"训练,证明数据质量远比数量重要
Gemma 系列
(Gemma (Google))
Google 开源轻量级模型家族,基于 Llama 架构改进,支持学术研究和商业使用
DiT
(Diffusion Transformer (扩散Transformer))
Sora 核心技术架构,将扩散模型与 Transformer 结合,用于视频/图像生成
稀疏注意力
(Sparse Attention)
只计算部分位置的注意力,复杂度从 O(n²) 降到 O(n log n),长文本必备优化
专家并行
(Expert Parallelism)
MoE 模型分布式训练策略,不同专家分布在不同 GPU 上,解决 MoE 通信瓶颈
一、模型架构与类型
AFM(Apple Foundation Model) Apple 自研基础模型,驱动 Apple Intelligence
BERT
(双向编码器表征)
Google 2018 年预训练模型,Transformer 编码器开山之作,擅长理解任务
CLIP
(对比语言-图像预训练)
OpenAI 多模态模型,连接文本和图像,Stable Diffusion 依赖其文本编码器
CNN
(卷积神经网络)
图像处理经典架构,通过卷积核提取局部特征,ResNet 是其代表
GAN
(生成对抗网络)
生成器 vs 判别器相互博弈训练,图像生成领域里程碑,训练极不稳定
LSTM
(长短期记忆网络)
RNN 改进版,通过门控机制解决长序列依赖,Transformer 出现前的 NLP 主力
Mamba
(状态空间模型)
2023 年新架构,用状态空间模型替代注意力,推理速度不随序列长度线性增长
MoE
(混合专家模型)
每次只激活部分"专家"子网络,参数多但计算少。Mixtral 和 DeepSeek-V2 采用
ResNet
(残差网络)
通过"跳跃连接"让深层网络可训练,CV 领域里程碑,ResNet-50/101/152
RNN
(循环神经网络)
处理序列数据的基础架构,按时间步递归,存在梯度消失问题
RoBERTa
(鲁棒优化的BERT)
Meta 对 BERT 的优化版,更多数据 + 更大batch + 更长训练,性能显著提升
RWKV
(Receptance加权键值)
结合 RNN 和 Transformer 优势,推理时是 RNN(快),训练时并行如 Transformer
SLM
(小语言模型)
参数 1B-10B 的轻量模型,可在手机/PC 本地运行,Phi、Gemma、Qwen 小尺寸版
T5
(文本到文本迁移Transformer)
Google "万物皆Seq2Seq" 模型,将所有 NLP 任务统一为文本到文本格式
U-Net 编码器-解码器 + 跳跃连接的 U 形架构,图像分割和扩散模型(Stable Diffusion)的核心
ViT
(视觉Transformer)
将图像切成 patch 像 token 一样输入 Transformer,证明 Transformer 在视觉也通用
VLM
(视觉语言模型)
能同时理解图像和文本的模型,GPT-4V、Gemini Vision、Qwen-VL 等
XLNet 通过排列语言建模改进 BERT,融合自回归和自编码优势
二、训练技术与优化器
Adam / AdamW 最主流的深度学习优化器,AdamW 加入权重衰减解耦,LLM 训练标配
SGD
(随机梯度下降)
经典优化算法,每次用随机小批量数据更新参数,收敛慢但泛化性好
Dropout 训练时随机丢弃部分神经元防止过拟合,推理时关闭
BatchNorm
(批归一化)
对每批数据标准化,加速训练收敛、允许更大学习率
LayerNorm
(层归一化)
沿特征维度归一化,不依赖 batch size,Transformer 标配
知识蒸馏 大模型(Teacher)教小模型(Student),让小模型继承能力,降低部署成本
模型剪枝 移除模型中贡献小的参数/连接,减小体积同时尽量保持精度
对比学习 拉近相似样本、推远不相似样本的自监督方法,SimCLR、MoCo 等框架
课程学习 模仿人类教育,训练数据从简单到困难逐步递进
迁移学习 将源任务学到的知识迁移到目标任务,预训练-微调范式即迁移学习
自监督学习 从无标注数据中构造监督信号(如下一句预测),LLM 预训练的核心范式
联邦学习 数据不出本地,多个参与方协作训练模型,保护隐私
持续学习 模型在学新任务时不遗忘旧知识(灾难性遗忘),仍为开放研究问题
AutoML
(自动机器学习)
自动搜索最优模型架构和超参数,减少人工调参工作量
NAS
(神经架构搜索)
AutoML 子领域,用强化学习或进化算法自动设计网络结构
超参数调优 搜索学习率、batch size、层数等最优组合,网格搜索/贝叶斯优化/随机搜索
DeepSpeed / ZeRO 微软分布式训练框架,ZeRO 分片优化器状态,让千亿参数训练在普通集群可行
FSDP
(全分片数据并行)
PyTorch 原生分布式策略,类似 ZeRO-3,分片模型参数/梯度/优化器状态
长上下文训练
(Long Context Training / RoPE Scaling)
通过位置编码扩展(NTK-aware/YaRN)让模型支持 128K+ 长度,2025 年标配能力
课程数据合成
(Curriculum Data Synthesis)
按难度梯度合成训练数据从简单到复杂逐步提升能力,DeepSeek-R1 核心技巧
多模态预训练
(Multimodal Pre-training)
统一图像/文本/音频/视频的联合预训练范式,GPT-4o/Gemini 原生多模态的基础
过程监督
(Process Supervision (PRM))
对推理每一步而非仅最终结果打奖惩,o1/DeepSeek-R1 推理能力的核心训练方法
三、微调与对齐方法
SFT
(监督微调)
用人工标注的问答数据微调基座模型,让模型学会遵守指令格式
LoRA
(低秩适配)
只训练少量额外参数(低秩矩阵),冻住原模型权重,极大降低微调成本
QLoRA
(量化低秩适配)
LoRA + 4-bit 量化,在单张消费级 GPU 上微调 65B 模型成为可能
PEFT
(参数高效微调)
微调方法总称:LoRA、Prefix Tuning、Adapter 等,只更新极少参数
DPO
(直接偏好优化)
RLHF 的简化替代,不需要单独训练奖励模型,直接优化偏好数据,更稳定
Constitutional AI Anthropic 提出,用 AI 反馈替代人类反馈做对齐,能低成本大规模扩展
GRPO
(分组相对策略优化)
DeepSeek-R1 使用的 RL 方法,组内比较奖励无需价值模型,降低 RL 训练开销
RLAIF
(AI反馈强化学习)
用 AI 模型替代人类标注员提供反馈,可扩展到 RLHF 难以覆盖的领域
在线 DPO / 迭代 DPO
(Online DPO / Iterative DPO)
迭代式直接偏好优化:生成样本→标注偏好→更新模型循环,效果远超一次性 DPO
KTO
(KTO (Kahneman-Tversky Optimization))
基于前景理论的偏好优化方法,只需"好/坏"二分类标签无需成对比较,降低标注成本
ORPO
(ORPO (Odd Ratio Preference Optimization))
将偏好优化融入 SFT 损失函数的单阶段方法,避免 RLHF 的多阶段复杂性
SimPO
(SimPO (Simple Preference Optimization))
无需奖励模型的简化偏好优化,使用平均对数概率作为隐式奖励,简单效果好
四、推理优化与部署
AWQ
(激活感知权重量化)
基于激活值分布保护重要权重通道,4-bit 量化精度损失极小
Flash Attention IO 感知的精确注意力算法,利用 GPU 内存层级降低访存,速度提升 2-4x
GGUF llama.cpp 使用的量化模型格式,支持 CPU 推理,让大模型在普通电脑运行
GPTQ 基于 OBQ 的逐层权重量化方法,INT4 精度下保持接近原始性能
KV Cache 缓存已计算的 Key/Value 矩阵避免重复计算,自回归推理必备优化
推测解码 用小模型快速生成候选,大模型并行验证,提速 2-3x 且无损输出质量
vLLM 高性能 LLM 推理引擎,PagedAttention 管理 KV Cache,吞吐量提升 10x+
KV Cache 量化
(KV Cache Quantization)
对 KV Cache 进行 INT8/INT4 量化大幅降低显存占用,长文本推理关键优化
连续批处理
(Continuous Batching / Dynamic Batching)
动态将请求加入批次避免等待最慢请求完成,vLLM/SGLang 标配特性
前缀缓存
(Prefix Caching)
缓存共享的系统提示前缀多用户复用减少重复计算,Chatbot 场景提速显著
张量并行
(Tensor Parallelism (TP))
将模型单层切分到多张 GPU 同步计算,大模型推理分布式标配
流水线并行
(Pipeline Parallelism (PP))
将模型各层分配到不同 GPU 按微批次流水线执行,减少 GPU 空闲等待时间
显存优化推理
(Memory-Efficient Inference)
包括卸载 offloading、算子融合 fusion 等综合优化策略,让小显卡跑大模型
结构化输出
(Structured Output / Constrained Decoding)
强制模型输出符合 JSON/正则等格式的文本,Agent 调用 API 时必需能力
五、评测指标与基准
BLEU 机器翻译评测,n-gram 匹配率。40+ 为优秀,但不够反映语义质量
ROUGE 文本摘要评测,关注召回率。ROUGE-1/2/L 常见,RNN 时代主力指标
MMLU
(大规模多任务语言理解)
57 个学科选择题,衡量模型知识广度。GPT-4 约 86%,是业界标准之一
HumanEval 164 道 Python 编程题,衡量代码生成能力,pass@k 为主要指标
GSM8K 8500 道小学数学应用题,衡量数学推理,需多步推理给出最终答案
Chatbot Arena LMSYS 组织的匿名对战平台,用 Elo 分排名,盲测结果公认最接近真实体验
MT-Bench 多轮对话评测,用 GPT-4 做裁判打分,涵盖写作/角色扮演/推理/编码等 8 类
HELM
(整体语言模型评估)
Stanford 多维评测框架,覆盖准确率/校准/鲁棒性/公平性/效率/毒性等
TruthfulQA 测试模型是否会复述常见误解和虚假信息,衡量"诚实度"
六、推理策略与 Prompt 技术
CoT
(思维链)
Few-shot 给出"一步步推理"示例,让 LLM 展示思考过程,数学题正确率翻倍
Auto-CoT 自动生成思维链示例,无需人工编写。先聚类问题再采样生成示范
ICL
(上下文学习)
在 Prompt 里给几个示例,模型就能举一反三,无需更新参数
Least-to-Most Prompting 将复杂问题拆成子问题逐个解决,每个子问题的解作为下一子问题的输入
PAL
(程序辅助语言模型)
让 LLM 生成代码来解题而非直接推理,将计算外包给 Python 解释器
ReAct
(推理+行动交替)
Thought → Action → Observation 循环,Agent 核心范式,结合推理与工具调用
Self-Consistency 采样多条推理路径取多数答案,用"投票"提升 CoT 稳定性
ToT
(思维树)
将推理探索成树形结构,用 BFS/DFS 搜索最佳路径,适合需要规划的任务
Zero-shot / Few-shot Zero-shot:不给示例直接问;Few-shot:给几个示例再问。ICL 的基础概念
七、RAG 高级技术
Agentic RAG Agent 自主决定何时检索、检索什么、检索后是否需补充,比标准 RAG 灵活
Chunking
(文本切块策略)
RAG 中决定如何切分文档:固定大小/语义/递归切分,直接影响检索质量
CRAG
(纠错式RAG)
引入检索评估器判断结果质量,质量差时自动触发 Web 搜索等补救
GraphRAG 用知识图谱替代向量存储做检索,适合需要多跳推理的复杂关联问题
HyDE
(假设文档嵌入)
先让 LLM 生成"假设答案"再用其检索,缩小问题与文档的语义鸿沟
混合搜索 向量语义搜索 + 关键词搜索(BM25)双路融合,互补长短
RRF
(倒数排名融合)
合并多路检索结果的经典算法,无需调权重,排名倒数求和后重排
八、智能体与工具框架
AutoGPT 2023 年爆火的开源自主 Agent,给定目标自动分解任务、搜索、执行、迭代
MemGPT 给 LLM 加上虚拟内存管理的 Agent 框架,模仿操作系统的分层记忆
Reflexion 让 Agent 在失败后自我反思,将改进经验存为长期记忆,下次避免同样错误
Toolformer Meta 提出,让 LLM 自学何时以及如何使用外部工具(计算器、搜索、翻译等)
MCP
(模型上下文协议)
Anthropic 推出的 Agent-工具标准化协议,Analog to USB-C for AI integrations
Agentic AI
(自主智能体 AI)
让 AI 具备自主感知、推理、规划、行动能力的范式。核心是单 Agent 能自主决定何时调工具、何时查资料、何时换思路。o1/o3、Computer Use、Codex 都是 Agentic AI 的代表
智能体集群
(Agent Cluster / Swarm)
多个专业化 Agent 分工协作的架构模式。各 Agent 各司其职(文案/设计/投放/分析),按协议通信、统一编排。CrewAI/AutoGen/LangGraph 是主流框架。核心价值:1+1>2 的协作效应
Agentic 工作流
(Agentic Workflow)
AI Agent 自主规划→执行→观察→反思的完整工作流模式,区别于简单的 LLM 调用
多 Agent 编排
(Multi-Agent Orchestration)
多个专业化 Agent 协作的模式:主管-工人/辩论/层级等,智能体集群核心设计模式
计划与执行分离
(Plan-and-Solve / Plan-and-Execute)
先完整规划任务步骤再逐步执行的 Agent 模式,适合复杂多步任务
工具使用
(Tool Use / Function Calling)
LLM 根据语义选择并调用外部 API 的能力,GPT-4/Claude 标配 Agent 基础能力
人机协作循环
(Human-in-the-loop (HITL))
关键决策由人类确认后再执行的安全模式,企业级 Agent 部署必备
记忆管理架构
(Memory Architecture)
Agent 记忆分层设计:短期(上下文窗口)/长期(向量数据库)/实体知识(知识图谱)
自我进化 Agent
(Self-Evolving Agent)
能从成功/失败经验中学习并优化自身行为策略的 Agent,Reflexion 延伸方向
LATS
(LATS (Language Agent Tree Search))
结合思维树搜索和反射机制的 Agent 框架,蒙特卡洛树搜索探索最佳行动序列
CAG
(CAG (Code Agent Generation))
代码生成专用 Agent 模式,理解代码库/编写代码/运行测试/修复 bug 自动化流程
开放 Agent 生态
(Open Agent Ecosystem)
MCP/A2A 等协议推动的跨平台 Agent 互操作标准,类似 USB-C for AI Agents
九、MLOps 与工程实践
MLOps
(机器学习运维)
ML 模型的持续集成/部署/监控,类比 DevOps。包含数据/模型/代码三管线
数据漂移 线上数据分布与训练数据渐行渐远,导致模型性能退化,需持续监控
模型漂移 模型预测行为随时间变化,可因环境变化或概念变化导致,触发重训练
NPU
(神经网络处理器)
专为神经网络推理设计的芯片,手机/PC 端侧 AI 推理核心
TPU
(张量处理器)
Google 定制 AI 加速芯片,Cloud TPU v5p 单 Pod 算力超百 PFlops
Checkpoint 训练过程中的模型快照,用于断点续训、回溯最佳版本、防止训练崩溃白费
Prompt 注入攻击
(Prompt Injection)
通过恶意输入劫持模型指令链让其忽略原始指令执行攻击者命令,最常见 AI 安全威胁
对抗性鲁棒性
(Adversarial Robustness)
模型抵抗故意扰动的能力,输入微小变化导致输出错误的风险评估
可解释 AI
(XAI (Explainable AI))
让黑盒模型决策过程可被人类理解的技术方向,监管合规和企业信任基础
AI 水印
(AI Watermarking / SynthID)
在 AI 生成内容中嵌入不可见标记以区分真伪,Google DeepMind SynthID 代表方案
宪法级对齐
(Constitutional AI (CAI))
Anthropic 提出基于原则集合的对齐方法,AI 自我批评+修订替代人工标注
沙箱执行环境
(Sandbox Execution)
Agent 执行代码/命令的隔离环境防止恶意操作影响宿主系统,企业部署安全底线
十、安全与对齐
Guardrails AI 应用安全护栏,输入/输出过滤层,防止注入攻击和敏感内容输出
越狱 通过精心构造 Prompt 绕过模型安全限制,使其输出原本拒绝的危险内容
红队测试 模拟攻击者测试模型安全性,OpenAI/Anthropic 等在新模型发布前必经流程
十一、中国特有及高频行业术语
信创 信息技术应用创新,国产替代国家战略。AI 芯片/框架/模型全链国产化受政策推动
RPA
(机器人流程自动化)
软件机器人自动执行重复性规则任务(填表/导数据),常与 AI Agent 配合使用
RGA
(检索增强生成式Agent)
RAG + Agent 融合范式,Agent 自主决策检索策略,不是简单的一问一检
AIGC
(AI生成内容)
AI 生成文字/图片/视频/音乐/代码。区别于 UGC 和 PGC 的第三代内容生产方式
AGI
(通用人工智能)
能完成任何人类智力任务的 AI。OpenAI 声称 AGI 可能在 2027-2030 年实现
NLP / CV / ASR / TTS / OCR 五大 AI 子领域:自然语言处理、计算机视觉、语音识别、语音合成、光学字符识别
Diffusion
(扩散模型)
逐步加噪再逆向去噪生成图像,Stable Diffusion/DALL-E 3/Sora 的核心技术
Scaling Law
(规模定律)
模型性能与参数量/数据量/计算量呈幂律关系,OpenAI 2020 年实证,指导大模型投入决策
Temperature
(温度参数)
控制模型输出的随机性:越低越确定(代码/事实),越高越有创意(诗歌/故事)
DALL-E / Midjourney / Sora DALL-E:OpenAI 文本生图;Midjourney:独立公司,艺术风格突出;Sora:OpenAI 文本生视频
十二、主流 AI 产品与应用
ChatGPT OpenAI 旗舰对话产品,2022.11 上线,2 个月破亿用户,全球 AI 普及的起点
Codex
(OpenAI 代码智能体)
OpenAI 云端软件工程智能体(2025重启),基于 o3 架构。能克隆仓库、改代码、跑测试、提 PR——异步自主执行编程任务。最新 GPT-5.3-Codex 是最强 agentic 编程模型
Claude Anthropic 对话产品,以安全性著称,Claude 3.5 Sonnet 编程能力行业领先
Gemini Google 多模态 AI 助手,整合搜索/Gmail/地图生态,原名 Bard
Copilot 微软 AI 助手品牌,深度整合 Office 365 / Windows / GitHub,企业级 AI 入口
Perplexity AI 搜索引擎,答案附带引用来源,被称为"Google 杀手"
Cursor AI 编程 IDE,基于 VS Code,支持自然语言改代码,开发者圈爆火
Devin Cognition AI 推出的"AI 软件工程师",可自主完成完整开发任务
Notion AI / 飞书智能伙伴 办公协作工具内嵌 AI,写文档/总结会议/自动填表
Suno / Udio AI 音乐生成工具,输入歌词+风格描述即可生成完整歌曲
Runway / Pika AI 视频生成/编辑平台,文字生成短视频片段
HeyGen / 数字人 AI 数字人视频生成,上传照片即可生成说话视频,跨境营销常用
Replit Agent / Bolt / Lovable 自然语言描述需求即可生成完整 Web 应用的 AI 编程工具
DeepSeek
(DeepSeek (深度求索))
中国 AI 公司 DeepSeek-V3/R1 系列震惊全球,开源最强推理模型极致性价比标杆
o1/o3/o4 系列
(OpenAI o1 / o3 / o4 Series)
OpenAI 推理增强模型引入 Test-Time Scaling 思维链推理数学/编程能力飞跃
GPT-5 系列
(GPT-5 / GPT-5.1 / GPT-5.2 / GPT-5.3)
OpenAI 2025 年发布的新一代旗舰模型系统多模态原生 Agentic 能力强
Claude 4 系列
(Claude 4 Opus / Sonnet / Haiku)
Anthropic 2025 发布的 Claude 4 代模型 Computer Use 能力大幅增强
Gemini 2.x 系列
(Gemini 2.0 / 2.5 Pro / Flash)
Google 新一代多模态模型原生多模态长上下文 Agent 能力三合一
Kimi K2
(Kimi K2 (月之暗面))
月之暗面 2025 发布的最新模型 MoE 架构+超长上下文中文能力突出
通义千问 Qwen 3
(Qwen 2.5 / Qwen 3 (通义千问))
阿里开源模型家族新版本 Qwen3 在多项基准接近闭源顶级水平
十三、核心公司与组织
OpenAI ChatGPT/GPT-4/Sora 创造者,估值超 1500 亿美元,AI 行业风向标
Anthropic Claude 创造者,由前 OpenAI 安全团队创立,主打 AI 安全与对齐
Google DeepMind Gemini 模型背后的团队,AlphaGo/AlphaFold 的创造者
Meta AI Llama 系列开源模型的推动者,Yann LeCun 领衔
xAI Elon Musk 创办的 AI 公司,推出 Grok 模型,强调"追求真理"
Mistral AI 法国明星 AI 公司,欧洲开源 LLM 代表,Mixtral 混合专家模型
Stability AI Stable Diffusion 母公司,开源图像生成模型领导者
Cohere 加拿大企业级 LLM 公司,专注 RAG 和 Embedding,服务企业客户
Hugging Face AI 模型开源社区/平台,号称"AI 界的 GitHub",托管数十万模型
Scale AI AI 数据标注独角兽,为 OpenAI/Google 等提供训练数据服务
智谱 / 月之暗面 / MiniMax / 零一万物 中国大模型"四小龙":ChatGLM / Kimi / 海螺AI / Yi 系列模型
百度 / 阿里 / 腾讯 / 字节 / 华为 中国科技巨头 AI 布局:文心 / 通义千问 / 混元 / 豆包 / 盘古
Harvey.ai
(Harvey.ai)
AI 法律助手独角兽服务全球顶尖律所垂直行业 AI 商业化标杆
Character.ai / Pi.ai
(Character.ai / Pi.ai)
AI 情感陪伴产品 Character.ai 月活过亿证明非工具类 AI 产品巨大市场
十四、开发框架与工具链
LangChain 最流行的 LLM 应用开发框架,链式调用 + Agent + 工具集成,Python/JS 双语言
LlamaIndex 专注数据索引和 RAG 的框架,擅长连接各种数据源构建知识库
LangGraph LangChain 团队的状态图 Agent 框架,用有向图定义多步骤 Agent 工作流
CrewAI 多 Agent 协作框架,定义角色/任务/团队,模拟组织协作
AutoGen 微软多 Agent 对话框架,多个 Agent 自动对话完成复杂任务
Dify / Coze / FastGPT 低代码 AI 应用搭建平台,拖拽式构建 RAG/Agent 应用,Dify 开源可私有部署
Semantic Kernel 微软 LLM 编排 SDK,深度集成 .NET/Azure 生态,企业级 AI 中间件
PyTorch / TensorFlow / JAX 三大深度学习框架:PyTorch 学术界主导,TensorFlow 工业界,JAX Google 力推
Ollama 一键本地运行开源 LLM 的工具,支持 Llama/Mistral/Qwen 等,极简 CLI
llama.cpp 纯 C/C++ LLM 推理引擎,支持 CPU 推理和 GGUF 量化格式,本地运行大模型基石
Hugging Face Transformers 最流行的预训练模型库,一行代码加载 BERT/GPT/T5 等数千模型
OpenAI Agents SDK
(OpenAI Agents SDK)
OpenAI 官方 Agent 开发框架内置 Agent Loop/Tool Use/状态管理 2025 重点推广
Vercel AI SDK
(Vercel AI SDK (AI SDK Core))
Next.js 生态 AI 开发套件提供流式生成/工具调用/RAG 统一抽象前端开发者首选
Haystack
(Haystack)
deepset 开源的 RAG/搜索框架擅长构建问答系统和语义搜索管道
LiteLLM
(LiteLLM)
统一 LLM API 代理层一行代码切换 OpenAI/Anthropic/本地模型开发者效率神器
Promptfoo
(Promptfoo)
LLM 输出质量评测工具批量测试 Prompt 变体回归测试防退化
DSPy
(DSPy)
斯坦福推出的程序化 Prompt 优化框架用代码定义 Pipeline 自动编译最优 Prompt
W&B
(Weights & Biases (W&B))
ML 实验追踪平台记录超参数/指标/模型版本团队协作标配
Fixie.ai
(Fixie.ai)
开源 Agent 平台类似 LangChain 但更轻量专注快速搭建功能性 Agent
十五、向量数据库与检索引擎
Pinecone 托管向量数据库,全托管免运维,适合快速原型和中小规模应用
Milvus / Zilliz 开源向量数据库,支持十亿级向量,分布式架构适合企业级部署
Chroma 轻量开源向量数据库,Python 原生,适合开发测试和嵌入应用
Weaviate 支持混合搜索的向量数据库,GraphQL 接口,内置向量化和摘要模块
Qdrant Rust 编写的高性能向量数据库,支持量化压缩和过滤搜索
FAISS Meta 开源向量检索库,十亿级近似最近邻检索,不是数据库但速度极快
Elasticsearch + 向量插件 传统搜索引擎 + 向量检索融合方案,企业搜索常用架构
十六、推理部署与优化
ONNX
(开放神经网络交换)
微软/ Meta 推动的模型互操作格式,PyTorch→ONNX→TensorRT 跨框架部署
TensorRT NVIDIA 推理优化引擎,针对自家 GPU 极致优化,吞吐量数倍提升
OpenVINO Intel 推理优化工具包,优化在 Intel CPU/GPU/NPU 上的 AI 推理性能
Triton Inference Server NVIDIA 推理服务器,支持多模型并发、动态批处理、GPU 共享
Ray / Ray Serve 分布式计算框架,模型训练+推理服务化,OpenAI 内部也在使用
Groq / LPU Groq 自研语言处理单元,推理速度极快(数百 token/秒),不是 GPU 架构
SGLang 高效 LLM 推理框架,结构化生成为核心优势,RadixAttention 管理 KV Cache
十七、评测基准补充
Arena Hard
(Arena Hard Auto)
自动化版 Chatbot Arena 用 LLM 裁判评测覆盖 8000+ 问题更新频率高
AlpacaEval
(AlpacaEval)
单轮指令遵循评测对比模型输出与 GPT-4 参考答案质量轻量快速
IFEval
(IFEval (Instruction Following Eval))
严格测试模型是否遵守格式/长度/关键词等可验证指令衡量可控性
MathBench
(MathBench)
中文数学推理评测覆盖小学到竞赛级别中文模型数学能力重要标尺
CRP Eval
(CRP (Code Reading & Processing) Eval)
代码阅读理解评测衡量模型读懂现有代码库并进行修改的能力
MultiPL-E
(MultiPL-E)
多语言编程评测扩展 HumanEval 到 20+ 编程语言衡量泛化能力
SWE-bench 真实 GitHub Issue 修复评测,衡量 AI 编程能力,Devin 在此创下纪录
GPQA 博士级科学推理评测,包含物理化学生物,难度极高
C-Eval / CMMLU 中文综合评测基准,覆盖 52/67 个学科,衡量中文模型能力的核心指标
AIME / AMC 国际数学竞赛题,DeepSeek-R1 和 o1 的核心评测赛道
LiveCodeBench 动态更新的编程评测,避免训练数据污染,问题来自最新编程竞赛
LongBench / RULER 长上下文评测,测试模型在 32K-128K+ token 输入下的理解能力
十八、新兴前沿概念
世界模型
(World Models)
AI 构建内部模拟环境来理解和预测物理世界的方向被视为通往 AGI 可能路径
具身智能
(Embodied AI)
AI 与物理世界交互的能力机器人控制/操作物体/空间导航下一代 AI 热点
推理计算优化
(Test-Time Compute (TTC) Optimization)
推理时动态决定投入多少计算量简单问题少算复杂问题多算 o1 核心创新
数据飞轮
(Data Flywheel)
用户使用数据反哺模型优化的正向循环 AI 产品建立壁垒的核心机制
小模型协同
(SLM Collaboration)
多个小模型分工协作完成复杂任务替代单个大模型降本增效新范式
边缘 AI
(Edge AI)
在设备端(手机/IoT/摄像头)本地运行 AI 模型低延迟+隐私保护部署趋势
绿色 AI
(Green AI)
关注 AI 训练和推理能耗与碳排放高效架构(SLM/Mamba)成为研究热点
主权 AI
(Sovereign AI)
国家/地区层面 AI 自主可控能力自建算力/自研模型/自有数据地缘政治新概念
A2A
(Agent-to-Agent)
Google 提出的 Agent 间通信协议,让不同框架开发的 Agent 互操作
Computer Use 让 AI 像人一样操作电脑:看屏幕、移动鼠标、点击、输入。Claude 首个商用
Deep Research AI 自动进行深度调研:搜索→阅读→分析→综合→输出报告,OpenAI/Google 均已推出
Synthetic Data 用 AI 生成训练数据,解决高质量数据枯竭问题,o1/Gemini 等新模型重度依赖
Model Collapse 用 AI 生成的数据训练 AI 会导致模型退化,是合成数据时代的核心风险
Test-Time Scaling 推理阶段增加计算量提升性能,o1/DeepSeek-R1 的核心技术,区别于训练时 Scaling
AI-Native / AI-First AI 原生:产品设计之初就以 AI 为核心,而非事后叠加。AI-Native 公司有结构性优势
使用建议

以上 240+ 词不需要一次性记住。浅层标签的词在讨论中听到能接上话即可;中层标签的词理解原理后能分析技术路线差异;深层标签的词是需要系统学习的大领域。建议把此页面加入书签,遇到陌生缩写随时来查。左侧搜索框支持快速检索,输入任意术语即可定位。

产业链全景:上游 —— 芯片与算力
AI 产业的食物链顶层:没有芯片就没有模型。谁掌握算力,谁就掌握定价权。

上游:芯片、算力与基础设施

成本占比最大、壁垒最高的一层
AI 训练芯片

大模型训练的核心硬件。英伟达 H100(全球 AI 训练芯片约 80% 份额)是最主流选择。H200/B200 新一代芯片算力持续翻倍。国产替代:华为昇腾 910B。

关键玩家:NVIDIA(英伟达)、华为(昇腾)、AMD、Intel
云计算平台

提供弹性 GPU 集群,按小时租赁。企业不需要一次性购买几千块 GPU,可以在云上按需使用。AWS、Azure、阿里云、华为云的 AI 业务都是增长最快板块。

关键玩家:AWS、Azure、Google Cloud、阿里云、华为云
AI 芯片设计 IP & EDA

芯片设计所需的核心 IP 和工具软件。ARM 提供芯片架构授权,Cadence/Synopsys 提供芯片设计 EDA 工具。随着自研 AI 芯片趋势,该层价值快速提升。

关键玩家:ARM、Cadence、Synopsys(新思科技)
AI 数据中心

大规模 GPU 集群需要专门的供电、散热、网络设施。一个万卡 H100 集群功耗相当于一个小型发电站。液冷散热成为标配,电力供应成为关键瓶颈。

关键玩家:Equinix、万国数据、秦淮数据
总架构图:AI 产业链上游 — 从沙子到算力

上游的核心是把原材料变成可用的计算能力。芯片设计 → 晶圆制造 → 封装测试 → 服务器集成 → 数据中心部署。

EDA工具
Cadence
Synopsys
芯片设计
NVIDIA/华为
ARM IP
晶圆制造
台积电/三星
7nm→3nm
GPU/加速卡
H100/B200
昇腾910B
服务器集成
超微/浪潮
8-GPU节点
智算中心
万卡集群
液冷供电
设计与研发 硬件产品 最终交付
产业链全景:中游 —— 大模型与平台
模型是 AI 产业的"引擎"。当前格局是:少数几家巨头训练基础模型,千百家创业公司做微调和应用。

中游:模型层与开发工具

技术创新最密集的一层
通用基础大模型

用全网数据训练的"全能型"模型,是所有下游应用的底座。训练一次成本数千万到数亿美元。全球有能力训练通用大模型的公司不超过 20 家。

关键玩家:OpenAI GPT、Google Gemini、Meta Llama、DeepSeek、文心、通义千问
模型 API 服务

把大模型包装成 API,按调用量计费。让任何开发者不需要 GPU 就能用上大模型。价格战最激烈的赛道:DeepSeek 价格仅为 GPT-4o 的 1/50。

关键玩家:OpenAI API、Anthropic API、DeepSeek API、阿里百炼、百度千帆
AI 开发平台与框架

提供工具链让开发者构建 AI 应用:Prompt 管理、RAG 编排、Agent 框架、评测体系。类比于"AI 时代的操作系统",做平台的人赚生态的钱。

关键玩家:LangChain、LlamaIndex、Dify、扣子(Coze)、百炼平台
向量数据库与数据平台

RAG 架构的基础设施,存储和检索向量化的知识。传统数据库巨头和新锐创业公司都在抢这个赛道。

关键玩家:Pinecone、Weaviate、Milvus(Zilliz)、Chroma、Elasticsearch
垂直/行业大模型

基于通用大模型,用行业数据微调的专用模型。医疗、法律、金融、编程等垂直领域。壁垒在于行业数据的获取和标注质量。

关键玩家:Harvey(法律)、Med-PaLM(医疗)、BloombergGPT(金融)
AI 安全与对齐

确保模型输出安全、合规、不产生有害内容。随着各国 AI 监管法规出台(欧盟 AI Act 等),安全合规成为模型上线的刚需环节。

关键玩家:Anthropic(安全优先理念)、各模型厂商内置安全团队
总架构图:AI 产业链中游 — 从模型训练到能力输出

中游做一件事:把算力变成可调用的"智能"。基础模型 → 微调 → API 服务 → 平台工具 → 行业垂直模型。

通用基础大模型

全网数据训练 · 数亿美金成本 · 全行业底座

▼ 输出:基座模型权重
模型 API 服务

按Token计费
价格战主战场

开发平台与框架

LangChain · Dify
扣子 · 百炼

安全与对齐

内容过滤 · 越狱防护
欧盟AI Act合规

▼ 支撑:向量数据库 / 数据平台(Milvus · Pinecone · Weaviate)
垂直行业大模型

医疗 · 法律 · 金融 · 编程 · 教育 · 制造

产业链全景:下游 —— 应用与 SaaS
离用户最近、创业机会最多的一层。用中游提供的模型能力,解决具体的行业痛点和用户需求。

下游:应用层与解决方案

变现最直接、模式最成熟的一层
对话与搜索

AI 对话助手和智能搜索引擎。ChatGPT 是现象级产品(2 个月破 1 亿用户)。传统搜索正在被 AI 搜索重构:Perplexity 的崛起让 Google 感受到了真正的威胁。

ChatGPT、Kimi、豆包、Perplexity、文心一言
内容生成 AIGC

AI 生成文字、图片、视频、音乐。广告素材、电商商品图、影视特效等场景需求巨大。Midjourney 年收入超 3 亿美元,Sora 正在颠覆视频制作行业。

Midjourney、DALL-E、Sora、Runway、可灵、即梦
代码智能体

AI 辅助编程、代码审查、自动测试。GitHub Copilot 是最成功的 AI 应用之一,有研究表明提升程序员效率 55%。这也是我们 OPC 的切入口方向。

GitHub Copilot、Cursor、Devin、通义灵码、文心快码
智能客服

用大模型替代传统关键词匹配的客服机器人。能真正理解客户意图,处理复杂退款、投诉场景。工单自动化 + 情绪识别 + 知识库 RAG。

Zendesk AI、Intercom Fin、智齿科技、网易七鱼
数据分析智能体

用户用自然语言问数据问题,Agent 自动写 SQL 分析。降低数据分析门槛从"需要会写代码"到"会说人话就行"。

ThoughtSpot、数说故事、阿里 DataV + AI
营销智能体

AI 自动生成广告文案、优化投放策略、做客户分群洞察。营销是 AI 落地最快的场景之一,因为 ROI 最直接可衡量。

Jasper、Copy.ai、蓝色光标 AI、巨量引擎 AI
垂直行业应用

医疗 AI 辅助诊断、法律文书自动起草、金融风控建模、教育个性化辅导、制造缺陷检测。每个垂直行业都有百亿级别的 AI 应用市场空间。

众多垂直 SaaS 公司 + AI 创业公司
多智能体协作平台

让多个 AI Agent 分工协作,完成复杂的端到端任务。比如:一个营销团队可以有文案 Agent + 设计 Agent + 投放 Agent + 分析 Agent。智能体集群是未来 3-5 年的核心方向。

AutoGen(微软)、CrewAI、Dify、扣子(Coze)
总架构图:AI 产业全链路 — 上游 → 中游 → 下游

三层的价值分配:上游赚硬件的钱(毛利高、壁垒厚),中游赚平台和 API 的钱(规模效应),下游赚解决方案和应用的钱(离用户最近、创新最快)。

上游:算力层

芯片 · 云平台 · 数据中心
英伟达 · 华为 · AWS

毛利 60-80%

中游:模型与平台层

大模型 · API · 开发框架
OpenAI · DeepSeek · LangChain

毛利 30-70%

对话 · 搜索

ChatGPT · Kimi

AIGC 内容

Midjourney · Sora

代码 Agent

Copilot · Cursor

智能客服

Zendesk AI

数据分析

自然语言→SQL

营销 Agent

文案 · 投放 · 洞察

垂直行业

医疗 · 法律 · 金融

多Agent协作

AutoGen · CrewAI

下游应用层 — 毛利 40-80%(取决于产品化程度)
海外版图:一超多强,资本竞赛
"一超"= OpenAI,"多强"= Google、Anthropic、Meta、微软。全在砸重金竞争,2025 年硅谷 AI 融资超千亿美元。

OpenAI 美国

行业绝对领跑者。ChatGPT 两个月破 1 亿用户创造互联网历史。累计融资超 100 亿美元,最大金主是微软。旗舰 GPT-4o 支持多模态输入输出。
维度详情
旗舰产品ChatGPT、GPT-4o(文字+图片+语音+视频全模态)
2024 年收入年化约 30-40 亿美元,ChatGPT Plus 订阅 + API 调用
中国对标文心一言、豆包(综合能力);DeepSeek(技术深度)

Anthropic 美国

OpenAI 前员工创立的"安全派",核心理念是 AI 安全对齐。与亚马逊 AWS 深度绑定。Claude 系列以超长上下文窗口和优雅文风著称。
维度详情
旗舰模型Claude 3.5 Opus / Sonnet,200K 上下文窗口
2024 年收入数亿美元级别,通过 AWS 渠道快速增长
差异化优势安全优先理念,Claude.ai 写作质量被公认业界最优

Google DeepMind 美国

全球 AI 研究产出最强的机构(Transformer、AlphaGo、AlphaFold 均出自其手)。Gemini 是 Google 的大模型系列。拥有数十亿用户的天然分发优势。
维度详情
旗舰模型Gemini 2.5 Pro,原生多模态,支持百万级上下文
独家资产海量自有数据(YouTube、搜索、Gmail)
分发渠道所有 Google 产品内置 + Android 系统预装

Meta AI(Facebook)美国

开源生态的绝对领导者。Llama 系列模型是整个开源大模型生态的能力基准。全球超 10 亿日活用户的天然分发网络。
维度详情
旗舰模型Llama 4(开源),主打部署性价比
战略意图开源以商品化市场、避免被 OpenAI 锁定;用 AI 优化内容推荐
生态影响基于 Llama 微调的模型占据开源榜单主导地位

其他重要海外玩家

公司市场定位核心产品
微软(Microsoft)AI 最大受益者。Copilot 深度嵌入 Office + GitHub,拥有 GPT 独家授权Copilot、Azure AI
苹果(Apple)端侧 AI 之王。Apple Intelligence 让大模型在 iPhone 本地运行Apple Intelligence
xAI(马斯克)激进闯入者。Grok 模型系列,122 天建成超级数据中心Grok
Mistral AI欧洲 AI 冠军。法语+英语双语优势,开源路线Mistral Large
英伟达(NVIDIA)上游之王。市值约 2.7 万亿美元,垄断 80%+ AI 训练 GPU 市场A100、H100、B200 GPU
中国版图:六强争霸 + 百花齐放
中国模型厂商有独特的数据、场景和用户规模优势。整体能力已追到 GPT-4 水平的约 75%,成本优势极其突出。

DeepSeek(深度求索)中国

2025 年最大黑马。以极低成本(训练预算约 500 万美元)实现 GPT-4 级别模型(DeepSeek-V3)。R1 推理模型对标 OpenAI o1。国产之光 + 开源标杆。
维度详情
旗舰模型DeepSeek-V3(GPT-4 级别,低成本);R1(推理模型)
核心优势极致性价比;全部开源;2025-2026 年全球轰动
背景母公司:幻方量化(量化对冲基金)

字节跳动(豆包)中国

中国最大的 AI 应用用户规模:豆包 App 月活超 1.5 亿。背靠抖音海量数据和算力资源。旗舰豆包-Pro 2.0 模型。
维度详情
旗舰产品豆包-Pro 2.0;豆包 App 月活 1.5 亿+(中国第一 AI 应用)
核心优势抖音流量分发能力;视觉和 3D 能力突出

智谱 AI(清华系)中国

清华技术班底,GLM 模型系列。产品线最完整:对话助手、API、企业 PMF 定制方案。国产大模型中综合实力最均衡的选手。
维度详情
旗舰模型GLM-4 / ChatGLM;企业 PMF 门户;AutoGLM(Agent 产品)
核心优势全栈能力;企业销售能力强;AutoGLM 智能体布局领先

其他重要中国玩家

公司市场定位核心产品
Kimi(月之暗面)长上下文先驱:1000 万 token 上下文窗口。中国估值最高 AI 独角兽Kimi 智能助手
文心一言(百度)AI 全栈布局最深;RAG + 企业服务能力强文心一言、文心大模型 API
通义千问(阿里)模型规模最大;Qwen 系列有大量细分微调变体通义千问系列(阿里云)
混元(腾讯)社交+游戏场景融合;企业微信深度集成腾讯混元大模型(腾讯云)
开源 vs 闭源 —— 2025-2026 年最强主线
这个二元对立的格局,将决定未来 3-5 年 AI 产业的钱流向哪里。
闭源阵营
  • OpenAI GPT-4o:性能第一梯队;API 定价最高
  • Anthropic Claude:安全第一;长文写作最优
  • Google Gemini:深度融合 Google 全家桶生态
  • 优势:性能最强、企业级安全保障、免运维
  • 劣势:成本最高、供应商锁定、数据需出企业
开源阵营
  • Meta Llama 4:生态最成熟、全球部署量最大
  • DeepSeek V3/R1:性价比之王、推理能力有优势
  • Mistral Large:欧洲主权 AI 的代表
  • 优势:成本低、可定制、数据主权可控、自由 Fork
  • 劣势:需自建运维团队、能力约闭源的 80-85%
关键趋势:开源模型正在吃掉 SaaS 市场的大头

闭源模型的溢价空间仅限于前 5% 的最关键应用场景。对于 90%+ 的企业场景,开源模型(Llama、DeepSeek)已经足够好用且成本仅为闭源的十分之一到二十分之一。这个格局和十年前云计算 vs 开源数据库的竞争逻辑如出一辙。

AI 行业六大变现模式
已经被市场验证过的商业模式。定价数据参考 2026 年 Q1 实际水平。
SaaS

SaaS 订阅

按月/年向用户或组织收取 AI 增强服务的订阅费。

单位经济学:人效成本碾压,订阅费通常仅为替代人力的 1/20

标杆产品:ChatGPT Plus $20/月;GitHub Copilot $10/月;Notion AI $10/座/月
API

API 按量计费

按每百万 token 收费,用量越大付费越多。

毛利率:30-70%,完全取决于 GPU 采购成本的议价能力

GPT-4o:$2.50/百万输入token;DeepSeek:$0.14(便宜 56 倍!)
私有

私有化部署

一次性部署费 + 年度维保费。面向金融、政务、军工等监管要求高的场景。

利润率最高:80%+ 毛利率,大企业倾向于本地安装

模型微调后在客户本地服务器部署,完全物理隔离运行
增值

增值服务(Freemium)

基础功能免费,高级功能(更高质量、更快速度、更多次数)收费。

获客成本趋零;考验免费到付费的转化精度

Notion AI:免费读摘要;付费无限写作和模板
飞轮

数据飞轮增值

客户使用产生数据 → 优化模型 → 服务更好 → 更多客户。

最难实现;合规审计常让飞轮梦碎

Salesforce Einstein:所有训练数据都留在客户 CRM 内
MaaS

模型即服务(MaaS)

把微调好的模型当产品卖,模型市场作为分发渠道。

只有在客户品牌绑定足够深时才成立

HuggingFace 模型市场;OpenAI GPT Store;阿里云 ModelScope
2025-2026 年真实行业变化

API 价格战白热化:DeepSeek 用极低成本证明了模型能力可以"白菜价"。SaaS+AI 模式已验证:现有 SaaS 加 AI 功能提升 ARPU 30-50%。私有化部署是利润中心:中国企业特别是国企和政府对本地 AI 部署需求巨大。垂直 AI Agent 毛利率 70%+,可能是对创业公司最有吸引力的新商业模式。

AI 公司的成本结构与定价策略
看懂 AI 公司的钱花在哪、怎么赚回来。
AI 创业公司成本结构
  • GPU / 算力(40-60%):最大单项成本,训练+推理合计
  • 工程师团队(25-35%):AI 研究员 + ML 工程师 + 基础设施团队
  • 数据与标注(5-15%):数据采购、标注、清洗
  • 基础设施(5-10%):云服务、监控、安全
  • 销售与商务(5-10%):企业销售周期平均 6-9 个月
AI SaaS 单位经济学
  • 年度客单价(ARPU):消费者 $120-$240;企业每座 $1,200-$12,000
  • 单用户月 GPU 成本:消费者 $0.5-$3;企业 $5-$30
  • 毛利率:消费者 60-85%;企业 50-70%;私有部署 80%+
  • 关键 KPI:单次 API 调用的推理 GPU 成本 × 24 小时 GPU 利用率
  • 流失率:消费者月流失 3-6%;企业年合同月流失 1-4%
定价核心策略

GPU 采购是黄金门票:大额云承诺(1 亿美元+)才能拿到最优 GPU 价格。推理优化是利润之源:量化压缩、缓存命中、提示词效率,每优化 1% 都是纯利润。企业销售真金在专业服务(咨询、定制、集成),毛利率超 65% 且客户粘性极强。开源替代正在颠覆:开源模型(Llama 4、DeepSeek)在 85-90% 场景下已够用,成本仅为闭源的 5-20%。

下一步:从看懂了到会用了

AI 概念不吓人——用对工具做对事才是核心能力。真正的 AI 商业壁垒在于把业务场景理解力和正确的技术组件组合在一起。做产业分析、行业分析、商业模式分析时,把这份报告当速查手册用。

OPC AI 方向 · 知识科普报告 · 2026.05 · 持续更新