AI 行业知识科普报告
从零基础到能看懂产业分析
一份面向分析师和决策者的 AI 产业入门指南。覆盖 240+ 核心概念、全产业链结构、50+ 全球关键玩家、六大商业模式。每个概念标注学习深度,帮你分配精力——知道该深挖什么,什么只是听过就行。
浅层必知人工智能(AI)
Artificial Intelligence,最宽泛的概念。凡是让机器模拟人类智能的技术都叫 AI:语音识别、下棋、自动驾驶,都算。AI 是一个目标,不是一项具体技术。
深层必知机器学习(ML)
Machine Learning,AI 的子集。机器从数据中自动学习规律,而不是靠人一条条写规则。今天的 AI 爆发,本质上就是机器学习的胜利。这是门完整学科,吴恩达的 Coursera 课程是经典入门。
深层必知深度学习(DL)
Deep Learning,ML 的子集。用多层神经网络处理数据。"深度"就是层数多。ChatGPT、Midjourney、Sora,底层全是深度学习。独立学科,推荐李沐《动手学深度学习》。
中层神经网络
深度学习的核心架构。由大量互相连接的"神经元"节点组成,每个节点接收输入、做计算、输出结果。参数就是连接权重——参数越多,模型越"聪明"。下方架构图直观展示层级结构。
图解:AI / ML / DL 包含关系 & 神经网络层级结构
左图:三层同心圆展示包含关系。右图:神经网络的"输入 → 隐藏层 → 输出"数据流动方式。
输入层
文本
图像
音频
隐藏层 1
提取边缘
基础特征
隐藏层 2
组合形状
中层特征
隐藏层 N
抽象语义
高层特征
输出层
分类
预测
生成
关键洞察:记住这个包含关系就够了
AI 是森林,ML 是长得最快的树种,DL 是最高最壮的那棵树。ChatGPT、文心一言、Sora,都属于深度学习分支。ML 和 DL 标注为"深层体系"——它们是独立学科,你现在不需要啃,但知道是需要系统学习的大领域就够了。
中层必知大语言模型(LLM)
Large Language Model,用海量文本训练出来的超大规模神经网络。参数动辄数千亿,能展现出推理、创作、编程等"涌现"能力。ChatGPT 背后的 GPT 系列就是 LLM。下方有 LLM 训练全流程图。
中层必知Transformer 架构
2017 年 Google 提出,几乎所有现代大语言模型的基石。核心创新是自注意力机制——让模型理解词与词之间的上下文关系。GPT 里的"T"就是 Transformer。下方有架构图解。
浅层GPT 系列模型
OpenAI 推出的大语言模型系列。GPT-1(2018) → GPT-2 → GPT-3(2020,1750亿参数) → GPT-3.5(ChatGPT) → GPT-4(2023) → GPT-4o(2024,多模态)。ChatGPT 是产品名,GPT 是模型名,别搞混。
中层必知多模态模型
能同时处理文字、图片、音频、视频的模型。GPT-4o 可以看图回答问题,Sora 能根据文字生成视频。从纯文本到多模态是一次质变。下方有融合架构图解。
浅层参数(Parameters)
衡量模型规模的指标。GPT-3:1750亿,GPT-4:估约1.8万亿。参数越多 = 模型越大 = 能力越强 = 训练越贵。但 DeepSeek 证明了架构创新同样重要。
浅层词元(Token)
大模型处理文本的最小单位。也是 API 调用的计费单位。1 个中文字 ≈ 1.5-2 个 token;1 个英文单词 ≈ 1-2 个 token。1000 token ≈ 750 英文词 ≈ 400-500 中文字。
浅层上下文窗口(Context Window)
模型一次能"记住"的最大文本量。GPT-4 Turbo:128K(≈ 一本中篇小说)。Gemini 1.5 Pro:号称 100 万 token。窗口越长,能处理的文档越大,但成本也越高。
中层涌现(Emergence)
当模型参数超过某个阈值后,突然展现出训练时没有明确教的"理解力"——推理、编程、翻译。推动科技巨头疯狂堆参数,科学界至今没完全解释清楚。
图解:Transformer 核心架构
GPT 只用了右半部分(Decoder),BERT 只用了左半部分(Encoder)。核心创新"自注意力机制"让每个词能直接关注到句子中所有其他词。
Encoder(编码器)— 理解任务
输入文本
"我 爱 AI"词嵌入 + 位置编码
词 → 向量 + 位置信息多头自注意力
每个词关注所有词前馈网络
逐位置变换上下文表示
词与词的关联矩阵Decoder(解码器)— 生成任务
已生成文本
"AI 是"掩码自注意力
只看前面的词交叉注意力
关注 Encoder 输出前馈网络
逐位置变换预测下一个词
"人工" ← 输出图解:多模态模型 — 不同信号如何融合
各模态先经各自的编码器处理成统一向量空间,再由融合层做跨模态理解,最后输出。
文本编码器
Transformer文本向量
图像编码器
ViT / CNN图像向量
音频编码器
Whisper音频向量
跨模态融合层
交叉注意力联合表征
多模态输出
文本/图像/语音产业关键认知
大语言模型不是"聊天程序"——它是一种新的基础能力平台,相当于工业革命里的电。它提供"通用智能"作为基础设施。这是理解整个 AI 产业商业逻辑的出发点。
中层必知预训练(Pre-training)
第一阶段。用万亿级 token 数据教模型"学会说话"。需要数千张 GPU 连续跑几个月,成本从几千万到几亿美元。下方有完整训练流程图。
深层必知微调(Fine-tuning)
在预训练模型基础上,用特定领域数据(几万条就够了)做二次训练。成本约是预训练的万分之一。大部分企业 AI 应用用的都是微调。预训练造通才,微调造专才。微调是一个方法体系:SFT、LoRA、QLoRA、RLHF、DPO。
浅层必知推理(Inference)
训练好的模型回答用户问题的过程。单次推理成本低到几分钱,但每天百万次调用累积下来,推理优化成为商业化的核心命题。
中层RLHF(人类反馈强化学习)
让人类对模型输出打分,模型据此调整行为。ChatGPT 之所以回答"像人"而不是胡说八道,靠的就是 RLHF。也是 AI 安全对齐的最后一道关。下方有 RLHF 流程图解。
中层量化(Quantization)
把参数精度压缩,减小模型体积和推理成本。让大模型能在手机上跑的关键技术。下方有精度对比表,一目了然。
浅层GPU(图形处理器)
原本用于游戏画面渲染,因为超强的并行计算能力成为 AI 训练的事实标准。英伟达(NVIDIA)占据全球 AI 训练芯片约 80% 市场。GPU 就是 AI 产业的"石油"。
图解:LLM 训练全流程(从数据到可用模型)
大模型诞生要经历三大阶段:海量无标注数据上的预训练(最贵)→ 有标注指令数据上的 SFT(较便宜)→ 人类偏好数据上的 RLHF 对齐(精细调教)。
原始数据
网页/书籍/代码数万亿Token
数据清洗
去重/过滤质量筛选
预训练
数千GPU·数月成本: $$$$$
基座模型
通才·会续写但不会对话
指令数据
数万条QA对人工标注
SFT 监督微调
数GPU·数小时成本: $$
指令模型
会遵循指令但仍可能胡说
偏好数据
人类对回答打分好坏对比
RLHF 对齐
奖励模型+PPO成本: $$
Chat模型
安全·友好像人一样说话
图解:RLHF — 人类反馈强化学习闭环
SFT 模型生成多个回答 → 人类标注员打分排序 → 训练奖励模型学会"判断好坏" → 用 PPO 算法更新主模型,反复循环直到模型输出符合人类偏好。
SFT模型
生成多个回答回答A/B/C
同一问题不同回答
人类标注员
打分排序A > B > C
训练奖励模型
学会预测人类偏好
奖励模型评分
给新回答打分PPO 更新模型
朝高分方向调整参数
新SFT模型
继续生成进入下一轮
图解:量化精度对比 — FP16 → INT8 → INT4
精度下降带来体积和速度的显著优化。FP16 是训练标配,INT8/INT4 是推理部署常用精度。
FP16(半精度浮点)
INT8(8位整数量化)
INT4(4位整数量化)
中层必知RAG(检索增强生成)
Retrieval-Augmented Generation。回答前先检索外部知识库,再把找到的内容作为"参考资料"喂给模型,模型据此生成答案。下方有 RAG 架构流程图。
中层必知智能体(Agent)
AI Agent,能自主观察、规划、执行任务的 AI 系统。不只是聊天——它能调用工具(搜索、计算、发邮件)、分步规划、反思纠错。下方有 Agent 架构图解。
浅层必知提示词(Prompt)
给大模型的输入指令。好的 Prompt 能让模型输出质量提升数倍。提示工程(Prompt Engineering) 是当下的热门技能,设计让模型乖乖听话的话术。
中层必知向量数据库(Vector DB)
RAG 的核心基础设施。把文本变成数学向量,做"语义相似度搜索"——不是关键词匹配,而是理解意思。下方 RAG 流程图中能看到它的位置。
中层函数调用(Function Calling)
让大模型按预定格式输出"想调用什么工具、传什么参数",外部程序执行后把结果返回。这是 Agent 能上网查资料、调数据库、控制软件的关键桥梁。
浅层幻觉(Hallucination)
大模型一本正经地胡说八道。编造人名、数据、论文——看起来像真的但全是凭空生成的。RAG 是目前最有效的缓解方案:用检索到的真实文档约束模型回答。
浅层嵌入(Embedding)
把文字/图片/声音变成一串数字(向量),语义相近的内容向量也相近。RAG 的搜索不是关键词匹配,而是语义接近度计算。
中层LangChain / LlamaIndex
最流行的两个 LLM 应用开发框架。LangChain 侧重链式调用和 Agent 编排,LlamaIndex 侧重数据索引和检索。做 AI 应用开发绕不开这两个。
图解:RAG — 检索增强生成完整流程
离线阶段(上半):文档切块 → 向量化 → 存入向量数据库。在线阶段(下半):用户提问 → 向量检索 → 拼接增强 Prompt → LLM 生成答案。
文档库
PDF/网页/数据库企业内部知识
文本切块
Chunking按语义切分段落
Embedding
向量化文本 → 向量
向量数据库
存为索引支持语义搜索
用户提问
"公司Q3营收多少?"
Embedding 查询
问题向量化向量检索
语义相似度Top-K 召回
拼接 Prompt
问题 + 检索到的上下文片段
LLM 生成答案
基于上下文不瞎编
图解:AI Agent — 自主智能体四大模块
Agent = LLM 大脑 + 工具调用 + 记忆系统 + 规划能力。四个模块协作让 Agent 能自主完成复杂任务。
LLM 大脑
GPT-4 / Claude /
文心 / DeepSeek
工具层
数据库 · API
代码执行器
记忆层
长期 · 用户偏好
共享 · 跨会话知识
规划层
反思纠错
ReAct / CoT
用户指令
规划分解
拆成步骤调用工具
执行子任务反思评估
结果是否正确输出/重试
重要区分
RAG 是给模型外接一个知识库,让模型能回答训练数据之外的问题。Agent 是给模型一个完整的行动框架——能使用工具、做计划、自我纠错。两者经常结合使用:Agent 在需要查资料时调用 RAG。
(Jamba (SSM+Transformer混合)) AI21 Labs 推出的 Mamba 状态空间模型+Transformer 混合架构,长上下文处理效率极高,140K 上下文窗口
(Phi (Microsoft)) 微软小参数高性能模型系列(Phi-1/2/3/4),用"教科书级数据"训练,证明数据质量远比数量重要
(Gemma (Google)) Google 开源轻量级模型家族,基于 Llama 架构改进,支持学术研究和商业使用
(Diffusion Transformer (扩散Transformer)) Sora 核心技术架构,将扩散模型与 Transformer 结合,用于视频/图像生成
(Sparse Attention) 只计算部分位置的注意力,复杂度从 O(n²) 降到 O(n log n),长文本必备优化
(Expert Parallelism) MoE 模型分布式训练策略,不同专家分布在不同 GPU 上,解决 MoE 通信瓶颈
(双向编码器表征) Google 2018 年预训练模型,Transformer 编码器开山之作,擅长理解任务
(对比语言-图像预训练) OpenAI 多模态模型,连接文本和图像,Stable Diffusion 依赖其文本编码器
(卷积神经网络) 图像处理经典架构,通过卷积核提取局部特征,ResNet 是其代表
(生成对抗网络) 生成器 vs 判别器相互博弈训练,图像生成领域里程碑,训练极不稳定
(长短期记忆网络) RNN 改进版,通过门控机制解决长序列依赖,Transformer 出现前的 NLP 主力
(状态空间模型) 2023 年新架构,用状态空间模型替代注意力,推理速度不随序列长度线性增长
(混合专家模型) 每次只激活部分"专家"子网络,参数多但计算少。Mixtral 和 DeepSeek-V2 采用
(残差网络) 通过"跳跃连接"让深层网络可训练,CV 领域里程碑,ResNet-50/101/152
(循环神经网络) 处理序列数据的基础架构,按时间步递归,存在梯度消失问题
(鲁棒优化的BERT) Meta 对 BERT 的优化版,更多数据 + 更大batch + 更长训练,性能显著提升
(Receptance加权键值) 结合 RNN 和 Transformer 优势,推理时是 RNN(快),训练时并行如 Transformer
(小语言模型) 参数 1B-10B 的轻量模型,可在手机/PC 本地运行,Phi、Gemma、Qwen 小尺寸版
(文本到文本迁移Transformer) Google "万物皆Seq2Seq" 模型,将所有 NLP 任务统一为文本到文本格式
(视觉Transformer) 将图像切成 patch 像 token 一样输入 Transformer,证明 Transformer 在视觉也通用
(视觉语言模型) 能同时理解图像和文本的模型,GPT-4V、Gemini Vision、Qwen-VL 等
(随机梯度下降) 经典优化算法,每次用随机小批量数据更新参数,收敛慢但泛化性好
(批归一化) 对每批数据标准化,加速训练收敛、允许更大学习率
(层归一化) 沿特征维度归一化,不依赖 batch size,Transformer 标配
(自动机器学习) 自动搜索最优模型架构和超参数,减少人工调参工作量
(神经架构搜索) AutoML 子领域,用强化学习或进化算法自动设计网络结构
(全分片数据并行) PyTorch 原生分布式策略,类似 ZeRO-3,分片模型参数/梯度/优化器状态
(Long Context Training / RoPE Scaling) 通过位置编码扩展(NTK-aware/YaRN)让模型支持 128K+ 长度,2025 年标配能力
(Curriculum Data Synthesis) 按难度梯度合成训练数据从简单到复杂逐步提升能力,DeepSeek-R1 核心技巧
(Multimodal Pre-training) 统一图像/文本/音频/视频的联合预训练范式,GPT-4o/Gemini 原生多模态的基础
(Process Supervision (PRM)) 对推理每一步而非仅最终结果打奖惩,o1/DeepSeek-R1 推理能力的核心训练方法
(监督微调) 用人工标注的问答数据微调基座模型,让模型学会遵守指令格式
(低秩适配) 只训练少量额外参数(低秩矩阵),冻住原模型权重,极大降低微调成本
(量化低秩适配) LoRA + 4-bit 量化,在单张消费级 GPU 上微调 65B 模型成为可能
(参数高效微调) 微调方法总称:LoRA、Prefix Tuning、Adapter 等,只更新极少参数
(直接偏好优化) RLHF 的简化替代,不需要单独训练奖励模型,直接优化偏好数据,更稳定
(分组相对策略优化) DeepSeek-R1 使用的 RL 方法,组内比较奖励无需价值模型,降低 RL 训练开销
(AI反馈强化学习) 用 AI 模型替代人类标注员提供反馈,可扩展到 RLHF 难以覆盖的领域
(Online DPO / Iterative DPO) 迭代式直接偏好优化:生成样本→标注偏好→更新模型循环,效果远超一次性 DPO
(KTO (Kahneman-Tversky Optimization)) 基于前景理论的偏好优化方法,只需"好/坏"二分类标签无需成对比较,降低标注成本
(ORPO (Odd Ratio Preference Optimization)) 将偏好优化融入 SFT 损失函数的单阶段方法,避免 RLHF 的多阶段复杂性
(SimPO (Simple Preference Optimization)) 无需奖励模型的简化偏好优化,使用平均对数概率作为隐式奖励,简单效果好
(激活感知权重量化) 基于激活值分布保护重要权重通道,4-bit 量化精度损失极小
(KV Cache Quantization) 对 KV Cache 进行 INT8/INT4 量化大幅降低显存占用,长文本推理关键优化
(Continuous Batching / Dynamic Batching) 动态将请求加入批次避免等待最慢请求完成,vLLM/SGLang 标配特性
(Prefix Caching) 缓存共享的系统提示前缀多用户复用减少重复计算,Chatbot 场景提速显著
(Tensor Parallelism (TP)) 将模型单层切分到多张 GPU 同步计算,大模型推理分布式标配
(Pipeline Parallelism (PP)) 将模型各层分配到不同 GPU 按微批次流水线执行,减少 GPU 空闲等待时间
(Memory-Efficient Inference) 包括卸载 offloading、算子融合 fusion 等综合优化策略,让小显卡跑大模型
(Structured Output / Constrained Decoding) 强制模型输出符合 JSON/正则等格式的文本,Agent 调用 API 时必需能力
(大规模多任务语言理解) 57 个学科选择题,衡量模型知识广度。GPT-4 约 86%,是业界标准之一
(整体语言模型评估) Stanford 多维评测框架,覆盖准确率/校准/鲁棒性/公平性/效率/毒性等
(思维链) Few-shot 给出"一步步推理"示例,让 LLM 展示思考过程,数学题正确率翻倍
(上下文学习) 在 Prompt 里给几个示例,模型就能举一反三,无需更新参数
(程序辅助语言模型) 让 LLM 生成代码来解题而非直接推理,将计算外包给 Python 解释器
(推理+行动交替) Thought → Action → Observation 循环,Agent 核心范式,结合推理与工具调用
(思维树) 将推理探索成树形结构,用 BFS/DFS 搜索最佳路径,适合需要规划的任务
(文本切块策略) RAG 中决定如何切分文档:固定大小/语义/递归切分,直接影响检索质量
(纠错式RAG) 引入检索评估器判断结果质量,质量差时自动触发 Web 搜索等补救
(假设文档嵌入) 先让 LLM 生成"假设答案"再用其检索,缩小问题与文档的语义鸿沟
(倒数排名融合) 合并多路检索结果的经典算法,无需调权重,排名倒数求和后重排
(模型上下文协议) Anthropic 推出的 Agent-工具标准化协议,Analog to USB-C for AI integrations
(自主智能体 AI) 让 AI 具备自主感知、推理、规划、行动能力的范式。核心是单 Agent 能自主决定何时调工具、何时查资料、何时换思路。o1/o3、Computer Use、Codex 都是 Agentic AI 的代表
(Agent Cluster / Swarm) 多个专业化 Agent 分工协作的架构模式。各 Agent 各司其职(文案/设计/投放/分析),按协议通信、统一编排。CrewAI/AutoGen/LangGraph 是主流框架。核心价值:1+1>2 的协作效应
(Agentic Workflow) AI Agent 自主规划→执行→观察→反思的完整工作流模式,区别于简单的 LLM 调用
(Multi-Agent Orchestration) 多个专业化 Agent 协作的模式:主管-工人/辩论/层级等,智能体集群核心设计模式
(Plan-and-Solve / Plan-and-Execute) 先完整规划任务步骤再逐步执行的 Agent 模式,适合复杂多步任务
(Tool Use / Function Calling) LLM 根据语义选择并调用外部 API 的能力,GPT-4/Claude 标配 Agent 基础能力
(Human-in-the-loop (HITL)) 关键决策由人类确认后再执行的安全模式,企业级 Agent 部署必备
(Memory Architecture) Agent 记忆分层设计:短期(上下文窗口)/长期(向量数据库)/实体知识(知识图谱)
(Self-Evolving Agent) 能从成功/失败经验中学习并优化自身行为策略的 Agent,Reflexion 延伸方向
(LATS (Language Agent Tree Search)) 结合思维树搜索和反射机制的 Agent 框架,蒙特卡洛树搜索探索最佳行动序列
(CAG (Code Agent Generation)) 代码生成专用 Agent 模式,理解代码库/编写代码/运行测试/修复 bug 自动化流程
(Open Agent Ecosystem) MCP/A2A 等协议推动的跨平台 Agent 互操作标准,类似 USB-C for AI Agents
(机器学习运维) ML 模型的持续集成/部署/监控,类比 DevOps。包含数据/模型/代码三管线
(神经网络处理器) 专为神经网络推理设计的芯片,手机/PC 端侧 AI 推理核心
(张量处理器) Google 定制 AI 加速芯片,Cloud TPU v5p 单 Pod 算力超百 PFlops
(Prompt Injection) 通过恶意输入劫持模型指令链让其忽略原始指令执行攻击者命令,最常见 AI 安全威胁
(Adversarial Robustness) 模型抵抗故意扰动的能力,输入微小变化导致输出错误的风险评估
(XAI (Explainable AI)) 让黑盒模型决策过程可被人类理解的技术方向,监管合规和企业信任基础
(AI Watermarking / SynthID) 在 AI 生成内容中嵌入不可见标记以区分真伪,Google DeepMind SynthID 代表方案
(Constitutional AI (CAI)) Anthropic 提出基于原则集合的对齐方法,AI 自我批评+修订替代人工标注
(Sandbox Execution) Agent 执行代码/命令的隔离环境防止恶意操作影响宿主系统,企业部署安全底线
(机器人流程自动化) 软件机器人自动执行重复性规则任务(填表/导数据),常与 AI Agent 配合使用
(检索增强生成式Agent) RAG + Agent 融合范式,Agent 自主决策检索策略,不是简单的一问一检
(AI生成内容) AI 生成文字/图片/视频/音乐/代码。区别于 UGC 和 PGC 的第三代内容生产方式
(通用人工智能) 能完成任何人类智力任务的 AI。OpenAI 声称 AGI 可能在 2027-2030 年实现
(扩散模型) 逐步加噪再逆向去噪生成图像,Stable Diffusion/DALL-E 3/Sora 的核心技术
(规模定律) 模型性能与参数量/数据量/计算量呈幂律关系,OpenAI 2020 年实证,指导大模型投入决策
(温度参数) 控制模型输出的随机性:越低越确定(代码/事实),越高越有创意(诗歌/故事)
(OpenAI 代码智能体) OpenAI 云端软件工程智能体(2025重启),基于 o3 架构。能克隆仓库、改代码、跑测试、提 PR——异步自主执行编程任务。最新 GPT-5.3-Codex 是最强 agentic 编程模型
(DeepSeek (深度求索)) 中国 AI 公司 DeepSeek-V3/R1 系列震惊全球,开源最强推理模型极致性价比标杆
(OpenAI o1 / o3 / o4 Series) OpenAI 推理增强模型引入 Test-Time Scaling 思维链推理数学/编程能力飞跃
(GPT-5 / GPT-5.1 / GPT-5.2 / GPT-5.3) OpenAI 2025 年发布的新一代旗舰模型系统多模态原生 Agentic 能力强
(Claude 4 Opus / Sonnet / Haiku) Anthropic 2025 发布的 Claude 4 代模型 Computer Use 能力大幅增强
(Gemini 2.0 / 2.5 Pro / Flash) Google 新一代多模态模型原生多模态长上下文 Agent 能力三合一
(Kimi K2 (月之暗面)) 月之暗面 2025 发布的最新模型 MoE 架构+超长上下文中文能力突出
(Qwen 2.5 / Qwen 3 (通义千问)) 阿里开源模型家族新版本 Qwen3 在多项基准接近闭源顶级水平
(Harvey.ai) AI 法律助手独角兽服务全球顶尖律所垂直行业 AI 商业化标杆
(Character.ai / Pi.ai) AI 情感陪伴产品 Character.ai 月活过亿证明非工具类 AI 产品巨大市场
(OpenAI Agents SDK) OpenAI 官方 Agent 开发框架内置 Agent Loop/Tool Use/状态管理 2025 重点推广
(Vercel AI SDK (AI SDK Core)) Next.js 生态 AI 开发套件提供流式生成/工具调用/RAG 统一抽象前端开发者首选
(Haystack) deepset 开源的 RAG/搜索框架擅长构建问答系统和语义搜索管道
(LiteLLM) 统一 LLM API 代理层一行代码切换 OpenAI/Anthropic/本地模型开发者效率神器
(Promptfoo) LLM 输出质量评测工具批量测试 Prompt 变体回归测试防退化
(DSPy) 斯坦福推出的程序化 Prompt 优化框架用代码定义 Pipeline 自动编译最优 Prompt
(Weights & Biases (W&B)) ML 实验追踪平台记录超参数/指标/模型版本团队协作标配
(Fixie.ai) 开源 Agent 平台类似 LangChain 但更轻量专注快速搭建功能性 Agent
(开放神经网络交换) 微软/ Meta 推动的模型互操作格式,PyTorch→ONNX→TensorRT 跨框架部署
(Arena Hard Auto) 自动化版 Chatbot Arena 用 LLM 裁判评测覆盖 8000+ 问题更新频率高
(AlpacaEval) 单轮指令遵循评测对比模型输出与 GPT-4 参考答案质量轻量快速
(IFEval (Instruction Following Eval)) 严格测试模型是否遵守格式/长度/关键词等可验证指令衡量可控性
(MathBench) 中文数学推理评测覆盖小学到竞赛级别中文模型数学能力重要标尺
(CRP (Code Reading & Processing) Eval) 代码阅读理解评测衡量模型读懂现有代码库并进行修改的能力
(MultiPL-E) 多语言编程评测扩展 HumanEval 到 20+ 编程语言衡量泛化能力
(World Models) AI 构建内部模拟环境来理解和预测物理世界的方向被视为通往 AGI 可能路径
(Embodied AI) AI 与物理世界交互的能力机器人控制/操作物体/空间导航下一代 AI 热点
(Test-Time Compute (TTC) Optimization) 推理时动态决定投入多少计算量简单问题少算复杂问题多算 o1 核心创新
(Data Flywheel) 用户使用数据反哺模型优化的正向循环 AI 产品建立壁垒的核心机制
(SLM Collaboration) 多个小模型分工协作完成复杂任务替代单个大模型降本增效新范式
(Edge AI) 在设备端(手机/IoT/摄像头)本地运行 AI 模型低延迟+隐私保护部署趋势
(Green AI) 关注 AI 训练和推理能耗与碳排放高效架构(SLM/Mamba)成为研究热点
(Sovereign AI) 国家/地区层面 AI 自主可控能力自建算力/自研模型/自有数据地缘政治新概念
(Agent-to-Agent) Google 提出的 Agent 间通信协议,让不同框架开发的 Agent 互操作
使用建议
以上 240+ 词不需要一次性记住。浅层标签的词在讨论中听到能接上话即可;中层标签的词理解原理后能分析技术路线差异;深层标签的词是需要系统学习的大领域。建议把此页面加入书签,遇到陌生缩写随时来查。左侧搜索框支持快速检索,输入任意术语即可定位。
上游:芯片、算力与基础设施
成本占比最大、壁垒最高的一层AI 训练芯片
大模型训练的核心硬件。英伟达 H100(全球 AI 训练芯片约 80% 份额)是最主流选择。H200/B200 新一代芯片算力持续翻倍。国产替代:华为昇腾 910B。
云计算平台
提供弹性 GPU 集群,按小时租赁。企业不需要一次性购买几千块 GPU,可以在云上按需使用。AWS、Azure、阿里云、华为云的 AI 业务都是增长最快板块。
AI 芯片设计 IP & EDA
芯片设计所需的核心 IP 和工具软件。ARM 提供芯片架构授权,Cadence/Synopsys 提供芯片设计 EDA 工具。随着自研 AI 芯片趋势,该层价值快速提升。
AI 数据中心
大规模 GPU 集群需要专门的供电、散热、网络设施。一个万卡 H100 集群功耗相当于一个小型发电站。液冷散热成为标配,电力供应成为关键瓶颈。
总架构图:AI 产业链上游 — 从沙子到算力
上游的核心是把原材料变成可用的计算能力。芯片设计 → 晶圆制造 → 封装测试 → 服务器集成 → 数据中心部署。
EDA工具
CadenceSynopsys
芯片设计
NVIDIA/华为ARM IP
晶圆制造
台积电/三星7nm→3nm
GPU/加速卡
H100/B200昇腾910B
服务器集成
超微/浪潮8-GPU节点
智算中心
万卡集群液冷供电
中游:模型层与开发工具
技术创新最密集的一层通用基础大模型
用全网数据训练的"全能型"模型,是所有下游应用的底座。训练一次成本数千万到数亿美元。全球有能力训练通用大模型的公司不超过 20 家。
模型 API 服务
把大模型包装成 API,按调用量计费。让任何开发者不需要 GPU 就能用上大模型。价格战最激烈的赛道:DeepSeek 价格仅为 GPT-4o 的 1/50。
AI 开发平台与框架
提供工具链让开发者构建 AI 应用:Prompt 管理、RAG 编排、Agent 框架、评测体系。类比于"AI 时代的操作系统",做平台的人赚生态的钱。
向量数据库与数据平台
RAG 架构的基础设施,存储和检索向量化的知识。传统数据库巨头和新锐创业公司都在抢这个赛道。
垂直/行业大模型
基于通用大模型,用行业数据微调的专用模型。医疗、法律、金融、编程等垂直领域。壁垒在于行业数据的获取和标注质量。
AI 安全与对齐
确保模型输出安全、合规、不产生有害内容。随着各国 AI 监管法规出台(欧盟 AI Act 等),安全合规成为模型上线的刚需环节。
总架构图:AI 产业链中游 — 从模型训练到能力输出
中游做一件事:把算力变成可调用的"智能"。基础模型 → 微调 → API 服务 → 平台工具 → 行业垂直模型。
通用基础大模型
全网数据训练 · 数亿美金成本 · 全行业底座
模型 API 服务
按Token计费
价格战主战场
开发平台与框架
LangChain · Dify
扣子 · 百炼
安全与对齐
内容过滤 · 越狱防护
欧盟AI Act合规
垂直行业大模型
医疗 · 法律 · 金融 · 编程 · 教育 · 制造
下游:应用层与解决方案
变现最直接、模式最成熟的一层对话与搜索
AI 对话助手和智能搜索引擎。ChatGPT 是现象级产品(2 个月破 1 亿用户)。传统搜索正在被 AI 搜索重构:Perplexity 的崛起让 Google 感受到了真正的威胁。
内容生成 AIGC
AI 生成文字、图片、视频、音乐。广告素材、电商商品图、影视特效等场景需求巨大。Midjourney 年收入超 3 亿美元,Sora 正在颠覆视频制作行业。
代码智能体
AI 辅助编程、代码审查、自动测试。GitHub Copilot 是最成功的 AI 应用之一,有研究表明提升程序员效率 55%。这也是我们 OPC 的切入口方向。
智能客服
用大模型替代传统关键词匹配的客服机器人。能真正理解客户意图,处理复杂退款、投诉场景。工单自动化 + 情绪识别 + 知识库 RAG。
数据分析智能体
用户用自然语言问数据问题,Agent 自动写 SQL 分析。降低数据分析门槛从"需要会写代码"到"会说人话就行"。
营销智能体
AI 自动生成广告文案、优化投放策略、做客户分群洞察。营销是 AI 落地最快的场景之一,因为 ROI 最直接可衡量。
垂直行业应用
医疗 AI 辅助诊断、法律文书自动起草、金融风控建模、教育个性化辅导、制造缺陷检测。每个垂直行业都有百亿级别的 AI 应用市场空间。
多智能体协作平台
让多个 AI Agent 分工协作,完成复杂的端到端任务。比如:一个营销团队可以有文案 Agent + 设计 Agent + 投放 Agent + 分析 Agent。智能体集群是未来 3-5 年的核心方向。
总架构图:AI 产业全链路 — 上游 → 中游 → 下游
三层的价值分配:上游赚硬件的钱(毛利高、壁垒厚),中游赚平台和 API 的钱(规模效应),下游赚解决方案和应用的钱(离用户最近、创新最快)。
上游:算力层
芯片 · 云平台 · 数据中心
英伟达 · 华为 · AWS
毛利 60-80%
中游:模型与平台层
大模型 · API · 开发框架
OpenAI · DeepSeek · LangChain
毛利 30-70%
对话 · 搜索
ChatGPT · Kimi
AIGC 内容
Midjourney · Sora
代码 Agent
Copilot · Cursor
智能客服
Zendesk AI
数据分析
自然语言→SQL
营销 Agent
文案 · 投放 · 洞察
垂直行业
医疗 · 法律 · 金融
多Agent协作
AutoGen · CrewAI
OpenAI 美国
| 维度 | 详情 |
|---|---|
| 旗舰产品 | ChatGPT、GPT-4o(文字+图片+语音+视频全模态) |
| 2024 年收入 | 年化约 30-40 亿美元,ChatGPT Plus 订阅 + API 调用 |
| 中国对标 | 文心一言、豆包(综合能力);DeepSeek(技术深度) |
Anthropic 美国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | Claude 3.5 Opus / Sonnet,200K 上下文窗口 |
| 2024 年收入 | 数亿美元级别,通过 AWS 渠道快速增长 |
| 差异化优势 | 安全优先理念,Claude.ai 写作质量被公认业界最优 |
Google DeepMind 美国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | Gemini 2.5 Pro,原生多模态,支持百万级上下文 |
| 独家资产 | 海量自有数据(YouTube、搜索、Gmail) |
| 分发渠道 | 所有 Google 产品内置 + Android 系统预装 |
Meta AI(Facebook)美国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | Llama 4(开源),主打部署性价比 |
| 战略意图 | 开源以商品化市场、避免被 OpenAI 锁定;用 AI 优化内容推荐 |
| 生态影响 | 基于 Llama 微调的模型占据开源榜单主导地位 |
其他重要海外玩家
| 公司 | 市场定位 | 核心产品 |
|---|---|---|
| 微软(Microsoft) | AI 最大受益者。Copilot 深度嵌入 Office + GitHub,拥有 GPT 独家授权 | Copilot、Azure AI |
| 苹果(Apple) | 端侧 AI 之王。Apple Intelligence 让大模型在 iPhone 本地运行 | Apple Intelligence |
| xAI(马斯克) | 激进闯入者。Grok 模型系列,122 天建成超级数据中心 | Grok |
| Mistral AI | 欧洲 AI 冠军。法语+英语双语优势,开源路线 | Mistral Large |
| 英伟达(NVIDIA) | 上游之王。市值约 2.7 万亿美元,垄断 80%+ AI 训练 GPU 市场 | A100、H100、B200 GPU |
DeepSeek(深度求索)中国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | DeepSeek-V3(GPT-4 级别,低成本);R1(推理模型) |
| 核心优势 | 极致性价比;全部开源;2025-2026 年全球轰动 |
| 背景 | 母公司:幻方量化(量化对冲基金) |
字节跳动(豆包)中国
| 维度 | 详情 |
|---|---|
| 旗舰产品 | 豆包-Pro 2.0;豆包 App 月活 1.5 亿+(中国第一 AI 应用) |
| 核心优势 | 抖音流量分发能力;视觉和 3D 能力突出 |
智谱 AI(清华系)中国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | GLM-4 / ChatGLM;企业 PMF 门户;AutoGLM(Agent 产品) |
| 核心优势 | 全栈能力;企业销售能力强;AutoGLM 智能体布局领先 |
其他重要中国玩家
| 公司 | 市场定位 | 核心产品 |
|---|---|---|
| Kimi(月之暗面) | 长上下文先驱:1000 万 token 上下文窗口。中国估值最高 AI 独角兽 | Kimi 智能助手 |
| 文心一言(百度) | AI 全栈布局最深;RAG + 企业服务能力强 | 文心一言、文心大模型 API |
| 通义千问(阿里) | 模型规模最大;Qwen 系列有大量细分微调变体 | 通义千问系列(阿里云) |
| 混元(腾讯) | 社交+游戏场景融合;企业微信深度集成 | 腾讯混元大模型(腾讯云) |
闭源阵营
- OpenAI GPT-4o:性能第一梯队;API 定价最高
- Anthropic Claude:安全第一;长文写作最优
- Google Gemini:深度融合 Google 全家桶生态
- 优势:性能最强、企业级安全保障、免运维
- 劣势:成本最高、供应商锁定、数据需出企业
开源阵营
- Meta Llama 4:生态最成熟、全球部署量最大
- DeepSeek V3/R1:性价比之王、推理能力有优势
- Mistral Large:欧洲主权 AI 的代表
- 优势:成本低、可定制、数据主权可控、自由 Fork
- 劣势:需自建运维团队、能力约闭源的 80-85%
关键趋势:开源模型正在吃掉 SaaS 市场的大头
闭源模型的溢价空间仅限于前 5% 的最关键应用场景。对于 90%+ 的企业场景,开源模型(Llama、DeepSeek)已经足够好用且成本仅为闭源的十分之一到二十分之一。这个格局和十年前云计算 vs 开源数据库的竞争逻辑如出一辙。
SaaS 订阅
按月/年向用户或组织收取 AI 增强服务的订阅费。
单位经济学:人效成本碾压,订阅费通常仅为替代人力的 1/20
API 按量计费
按每百万 token 收费,用量越大付费越多。
毛利率:30-70%,完全取决于 GPU 采购成本的议价能力
私有化部署
一次性部署费 + 年度维保费。面向金融、政务、军工等监管要求高的场景。
利润率最高:80%+ 毛利率,大企业倾向于本地安装
增值服务(Freemium)
基础功能免费,高级功能(更高质量、更快速度、更多次数)收费。
获客成本趋零;考验免费到付费的转化精度
数据飞轮增值
客户使用产生数据 → 优化模型 → 服务更好 → 更多客户。
最难实现;合规审计常让飞轮梦碎
模型即服务(MaaS)
把微调好的模型当产品卖,模型市场作为分发渠道。
只有在客户品牌绑定足够深时才成立
2025-2026 年真实行业变化
API 价格战白热化:DeepSeek 用极低成本证明了模型能力可以"白菜价"。SaaS+AI 模式已验证:现有 SaaS 加 AI 功能提升 ARPU 30-50%。私有化部署是利润中心:中国企业特别是国企和政府对本地 AI 部署需求巨大。垂直 AI Agent 毛利率 70%+,可能是对创业公司最有吸引力的新商业模式。
AI 创业公司成本结构
- GPU / 算力(40-60%):最大单项成本,训练+推理合计
- 工程师团队(25-35%):AI 研究员 + ML 工程师 + 基础设施团队
- 数据与标注(5-15%):数据采购、标注、清洗
- 基础设施(5-10%):云服务、监控、安全
- 销售与商务(5-10%):企业销售周期平均 6-9 个月
AI SaaS 单位经济学
- 年度客单价(ARPU):消费者 $120-$240;企业每座 $1,200-$12,000
- 单用户月 GPU 成本:消费者 $0.5-$3;企业 $5-$30
- 毛利率:消费者 60-85%;企业 50-70%;私有部署 80%+
- 关键 KPI:单次 API 调用的推理 GPU 成本 × 24 小时 GPU 利用率
- 流失率:消费者月流失 3-6%;企业年合同月流失 1-4%
定价核心策略
GPU 采购是黄金门票:大额云承诺(1 亿美元+)才能拿到最优 GPU 价格。推理优化是利润之源:量化压缩、缓存命中、提示词效率,每优化 1% 都是纯利润。企业销售真金在专业服务(咨询、定制、集成),毛利率超 65% 且客户粘性极强。开源替代正在颠覆:开源模型(Llama 4、DeepSeek)在 85-90% 场景下已够用,成本仅为闭源的 5-20%。
下一步:从看懂了到会用了
AI 概念不吓人——用对工具做对事才是核心能力。真正的 AI 商业壁垒在于把业务场景理解力和正确的技术组件组合在一起。做产业分析、行业分析、商业模式分析时,把这份报告当速查手册用。
OPC AI 方向 · 知识科普报告 · 2026.05 · 持续更新