AI 行业知识科普报告
从零基础到能看懂产业分析
一份面向分析师和决策者的 AI 产业入门指南。覆盖 500+ 核心概念、全产业链结构、100+ 全球关键玩家、六大商业模式。每个概念标注学习深度,帮你分配精力——知道该深挖什么,什么只是听过就行。
浅层必知人工智能(AI)
Artificial Intelligence,最宽泛的概念。凡是让机器模拟人类智能的技术都叫 AI:语音识别、下棋、自动驾驶,都算。AI 是一个目标,不是一项具体技术。
深层必知机器学习(ML)
Machine Learning,AI 的子集。机器从数据中自动学习规律,而不是靠人一条条写规则。今天的 AI 爆发,本质上就是机器学习的胜利。这是门完整学科,吴恩达的 Coursera 课程是经典入门。
深层必知深度学习(DL)
Deep Learning,ML 的子集。用多层神经网络处理数据。"深度"就是层数多。ChatGPT、Midjourney、Sora,底层全是深度学习。独立学科,推荐李沐《动手学深度学习》。
中层神经网络
深度学习的核心架构。由大量互相连接的"神经元"节点组成,每个节点接收输入、做计算、输出结果。参数就是连接权重——参数越多,模型越"聪明"。下方架构图直观展示层级结构。
图解:AI / ML / DL 包含关系 & 神经网络层级结构
左图:三层同心圆展示包含关系。右图:神经网络的"输入 → 隐藏层 → 输出"数据流动方式。
输入层
文本
图像
音频
隐藏层 1
提取边缘
基础特征
隐藏层 2
组合形状
中层特征
隐藏层 N
抽象语义
高层特征
输出层
分类
预测
生成
关键洞察:记住这个包含关系就够了
AI 是森林,ML 是长得最快的树种,DL 是最高最壮的那棵树。ChatGPT、文心一言、Sora,都属于深度学习分支。ML 和 DL 标注为"深层体系"——它们是独立学科,你现在不需要啃,但知道是需要系统学习的大领域就够了。
中层必知大语言模型(LLM)
Large Language Model,用海量文本训练出来的超大规模神经网络。参数动辄数千亿,能展现出推理、创作、编程等"涌现"能力。ChatGPT 背后的 GPT 系列就是 LLM。下方有 LLM 训练全流程图。
中层必知Transformer 架构
2017 年 Google 提出,几乎所有现代大语言模型的基石。核心创新是自注意力机制——让模型理解词与词之间的上下文关系。GPT 里的"T"就是 Transformer。下方有架构图解。
浅层GPT 系列模型
OpenAI 推出的大语言模型系列。GPT-1(2018) → GPT-2 → GPT-3(2020,1750亿参数) → GPT-3.5(ChatGPT) → GPT-4(2023) → GPT-4o(2024,多模态)。ChatGPT 是产品名,GPT 是模型名,别搞混。
中层必知多模态模型
能同时处理文字、图片、音频、视频的模型。GPT-4o 可以看图回答问题,Sora 能根据文字生成视频。从纯文本到多模态是一次质变。下方有融合架构图解。
浅层参数(Parameters)
衡量模型规模的指标。GPT-3:1750亿,GPT-4:估约1.8万亿。参数越多 = 模型越大 = 能力越强 = 训练越贵。但 DeepSeek 证明了架构创新同样重要。
浅层词元(Token)
大模型处理文本的最小单位。也是 API 调用的计费单位。1 个中文字 ≈ 1.5-2 个 token;1 个英文单词 ≈ 1-2 个 token。1000 token ≈ 750 英文词 ≈ 400-500 中文字。
浅层上下文窗口(Context Window)
模型一次能"记住"的最大文本量。GPT-4 Turbo:128K(≈ 一本中篇小说)。Gemini 1.5 Pro:号称 100 万 token。窗口越长,能处理的文档越大,但成本也越高。
中层涌现(Emergence)
当模型参数超过某个阈值后,突然展现出训练时没有明确教的"理解力"——推理、编程、翻译。推动科技巨头疯狂堆参数,科学界至今没完全解释清楚。
图解:Transformer 核心架构
GPT 只用了右半部分(Decoder),BERT 只用了左半部分(Encoder)。核心创新"自注意力机制"让每个词能直接关注到句子中所有其他词。
Encoder(编码器)— 理解任务
输入文本
"我 爱 AI"词嵌入 + 位置编码
词 → 向量 + 位置信息多头自注意力
每个词关注所有词前馈网络
逐位置变换上下文表示
词与词的关联矩阵Decoder(解码器)— 生成任务
已生成文本
"AI 是"掩码自注意力
只看前面的词交叉注意力
关注 Encoder 输出前馈网络
逐位置变换预测下一个词
"人工" ← 输出图解:多模态模型 — 不同信号如何融合
各模态先经各自的编码器处理成统一向量空间,再由融合层做跨模态理解,最后输出。
文本编码器
Transformer文本向量
图像编码器
ViT / CNN图像向量
音频编码器
Whisper音频向量
跨模态融合层
交叉注意力联合表征
多模态输出
文本/图像/语音产业关键认知
大语言模型不是"聊天程序"——它是一种新的基础能力平台,相当于工业革命里的电。它提供"通用智能"作为基础设施。这是理解整个 AI 产业商业逻辑的出发点。
中层必知预训练(Pre-training)
第一阶段。用万亿级 token 数据教模型"学会说话"。需要数千张 GPU 连续跑几个月,成本从几千万到几亿美元。下方有完整训练流程图。
深层必知微调(Fine-tuning)
在预训练模型基础上,用特定领域数据(几万条就够了)做二次训练。成本约是预训练的万分之一。大部分企业 AI 应用用的都是微调。预训练造通才,微调造专才。微调是一个方法体系:SFT、LoRA、QLoRA、RLHF、DPO。
浅层必知推理(Inference)
训练好的模型回答用户问题的过程。单次推理成本低到几分钱,但每天百万次调用累积下来,推理优化成为商业化的核心命题。
中层RLHF(人类反馈强化学习)
让人类对模型输出打分,模型据此调整行为。ChatGPT 之所以回答"像人"而不是胡说八道,靠的就是 RLHF。也是 AI 安全对齐的最后一道关。下方有 RLHF 流程图解。
中层量化(Quantization)
把参数精度压缩,减小模型体积和推理成本。让大模型能在手机上跑的关键技术。下方有精度对比表,一目了然。
浅层GPU(图形处理器)
原本用于游戏画面渲染,因为超强的并行计算能力成为 AI 训练的事实标准。英伟达(NVIDIA)占据全球 AI 训练芯片约 80% 市场。GPU 就是 AI 产业的"石油"。
图解:LLM 训练全流程(从数据到可用模型)
大模型诞生要经历三大阶段:海量无标注数据上的预训练(最贵)→ 有标注指令数据上的 SFT(较便宜)→ 人类偏好数据上的 RLHF 对齐(精细调教)。
原始数据
网页/书籍/代码数万亿Token
数据清洗
去重/过滤质量筛选
预训练
数千GPU·数月成本: $$$$$
基座模型
通才·会续写但不会对话
指令数据
数万条QA对人工标注
SFT 监督微调
数GPU·数小时成本: $$
指令模型
会遵循指令但仍可能胡说
偏好数据
人类对回答打分好坏对比
RLHF 对齐
奖励模型+PPO成本: $$
Chat模型
安全·友好像人一样说话
图解:RLHF — 人类反馈强化学习闭环
SFT 模型生成多个回答 → 人类标注员打分排序 → 训练奖励模型学会"判断好坏" → 用 PPO 算法更新主模型,反复循环直到模型输出符合人类偏好。
SFT模型
生成多个回答回答A/B/C
同一问题不同回答
人类标注员
打分排序A > B > C
训练奖励模型
学会预测人类偏好
奖励模型评分
给新回答打分PPO 更新模型
朝高分方向调整参数
新SFT模型
继续生成进入下一轮
图解:量化精度对比 — FP16 → INT8 → INT4
精度下降带来体积和速度的显著优化。FP16 是训练标配,INT8/INT4 是推理部署常用精度。
FP16(半精度浮点)
INT8(8位整数量化)
INT4(4位整数量化)
中层必知RAG(检索增强生成)
Retrieval-Augmented Generation。回答前先检索外部知识库,再把找到的内容作为"参考资料"喂给模型,模型据此生成答案。下方有 RAG 架构流程图。
中层必知智能体(Agent)
AI Agent,能自主观察、规划、执行任务的 AI 系统。不只是聊天——它能调用工具(搜索、计算、发邮件)、分步规划、反思纠错。下方有 Agent 架构图解。
浅层必知提示词(Prompt)
给大模型的输入指令。好的 Prompt 能让模型输出质量提升数倍。提示工程(Prompt Engineering) 是当下的热门技能,设计让模型乖乖听话的话术。
中层必知向量数据库(Vector DB)
RAG 的核心基础设施。把文本变成数学向量,做"语义相似度搜索"——不是关键词匹配,而是理解意思。下方 RAG 流程图中能看到它的位置。
中层函数调用(Function Calling)
让大模型按预定格式输出"想调用什么工具、传什么参数",外部程序执行后把结果返回。这是 Agent 能上网查资料、调数据库、控制软件的关键桥梁。
浅层幻觉(Hallucination)
大模型一本正经地胡说八道。编造人名、数据、论文——看起来像真的但全是凭空生成的。RAG 是目前最有效的缓解方案:用检索到的真实文档约束模型回答。
浅层嵌入(Embedding)
把文字/图片/声音变成一串数字(向量),语义相近的内容向量也相近。RAG 的搜索不是关键词匹配,而是语义接近度计算。
中层LangChain / LlamaIndex
最流行的两个 LLM 应用开发框架。LangChain 侧重链式调用和 Agent 编排,LlamaIndex 侧重数据索引和检索。做 AI 应用开发绕不开这两个。
图解:RAG — 检索增强生成完整流程
离线阶段(上半):文档切块 → 向量化 → 存入向量数据库。在线阶段(下半):用户提问 → 向量检索 → 拼接增强 Prompt → LLM 生成答案。
文档库
PDF/网页/数据库企业内部知识
文本切块
Chunking按语义切分段落
Embedding
向量化文本 → 向量
向量数据库
存为索引支持语义搜索
用户提问
"公司Q3营收多少?"
Embedding 查询
问题向量化向量检索
语义相似度Top-K 召回
拼接 Prompt
问题 + 检索到的上下文片段
LLM 生成答案
基于上下文不瞎编
图解:AI Agent — 自主智能体四大模块
Agent = LLM 大脑 + 工具调用 + 记忆系统 + 规划能力。四个模块协作让 Agent 能自主完成复杂任务。
LLM 大脑
GPT-4 / Claude /
文心 / DeepSeek
工具层
数据库 · API
代码执行器
记忆层
长期 · 用户偏好
共享 · 跨会话知识
规划层
反思纠错
ReAct / CoT
用户指令
规划分解
拆成步骤调用工具
执行子任务反思评估
结果是否正确输出/重试
重要区分
RAG 是给模型外接一个知识库,让模型能回答训练数据之外的问题。Agent 是给模型一个完整的行动框架——能使用工具、做计划、自我纠错。两者经常结合使用:Agent 在需要查资料时调用 RAG。
(Jamba (SSM+Transformer混合)) AI21 Labs 推出的 Mamba 状态空间模型+Transformer 混合架构,长上下文处理效率极高,140K 上下文窗口
(Phi (Microsoft)) 微软小参数高性能模型系列(Phi-1/2/3/4),用"教科书级数据"训练,证明数据质量远比数量重要
(Gemma (Google)) Google 开源轻量级模型家族,基于 Llama 架构改进,支持学术研究和商业使用
(Diffusion Transformer (扩散Transformer)) Sora 核心技术架构,将扩散模型与 Transformer 结合,用于视频/图像生成
(Sparse Attention) 只计算部分位置的注意力,复杂度从 O(n²) 降到 O(n log n),长文本必备优化
(Expert Parallelism) MoE 模型分布式训练策略,不同专家分布在不同 GPU 上,解决 MoE 通信瓶颈
(Prompt) 用户输入给 AI 模型的指令文本,是人与 AI 交互的核心接口。好的 Prompt 能显著提升输出质量,因此催生了"提示工程"(Prompt Engineering)这一专门技能。Prompt 包含:任务指令、上下文信息、输出格式要求、示例等要素
(词元) LLM 处理文本的最小单位,约 0.7-1 个汉字或 0.75 个英文单词为一个 Token。模型上下文长度、API 计费、推理速度均以 Token 为计量单位。中文"人工智能"约 3-4 Token
(大语言模型) 参数量数十亿到万亿级别的深度学习语言模型,通过海量文本预训练获得通用语言理解和生成能力。GPT、Llama、Claude、Qwen、DeepSeek 均属 LLM。是当前 AI 浪潮的核心技术载体
(Base Model) 经过预训练但未经过指令微调的原始大模型。基座模型具备通用语言能力但不会"听话"——需要 SFT(监督微调)后才能成为可用的对话模型。如 Llama 3 Base vs Llama 3 Instruct
(Pre-training) 用海量无标注文本数据训练基座模型的过程,耗时数周到数月、花费数百万到数千万美元。模型的大部分"知识"在此阶段获得,是 AI 公司核心壁垒所在
(Fine-tuning) 在预训练模型基础上用特定领域/任务数据继续训练,使模型适配特定场景。包含 SFT(监督微调)、LoRA(低秩适配)、RLHF(人类反馈强化学习)等多种方法。区别于从零训练
(Context Window) 模型单次能处理的最大 Token 数量,决定了"记忆容量"。2024 年前主流为 4K-8K,2025 年已普及 128K-1M+。长上下文能力是模型竞争的关键维度之一
(Embedding / 向量化) 将文本/图像等非结构化数据转换为高维向量(数数字列表),语义相似的输入在向量空间中距离更近。RAG 检索、语义搜索、推荐系统的核心技术基础
(检索增强生成) Retrieval-Augmented Generation:先从外部知识库检索相关文档,再将文档作为上下文交给 LLM 生成回答。解决模型知识过时和幻觉问题,企业落地 AI 的首选架构模式
(Agent) 能自主感知环境、规划任务、调用工具、执行行动的 AI 系统。区别于简单 LLM 对话:Agent 具有循环推理(ReAct)、工具使用(Tool Use)、记忆管理等完整能力闭环
(Hallucination) 模型生成看似合理但实际上虚假或不准确的内容。LLM 的固有缺陷,源于概率性生成的本质。RAG 和引用机制是主要缓解手段,完全消除仍是开放研究问题
(Alignment) 让 AI 模型的行为符合人类意图和价值观的技术方向。包括:安全对齐(拒绝有害请求)、意图对齐(遵循指令)、价值观对齐(文化/伦理一致)。RLHF/DPO/Constitutional AI 是主要方法
(System Prompt) 开发者预设的"角色设定"指令,在每次对话开始时注入,定义 AI 的身份、行为规范和能力边界。相当于给 AI 设定的"人设"和"操作手册",是产品化 AI 的关键控制手段
(Prompt Engineering) 设计和优化 Prompt 以获得最佳模型输出的实践技能。包含:CoT(思维链)、Few-shot(少样本)、角色设定、格式约束等技术。好的 Prompt 工程可在不改变模型的情况下大幅提升效果
(Token 经济学) LLM API 按 Token 计费的商业逻辑:理解输入/输出 Token 定价规则、估算成本、控制预算。GPT-4o 约 $2.5/M 输入 Token,DeepSeek 仅为其 1/10,成本差异直接影响产品可行性
(双向编码器表征) Google 2018年发布,基于Transformer编码器的预训练模型,通过掩码语言模型和下一句预测任务训练。NLP领域里程碑,奠定了"预训练+微调"范式,擅长文本理解与分类任务
(对比语言-图像预训练) OpenAI 多模态模型,连接文本和图像,Stable Diffusion 依赖其文本编码器
(卷积神经网络) 图像处理经典架构,通过卷积核提取局部特征,ResNet 是其代表
(生成对抗网络) 生成器 vs 判别器相互博弈训练,图像生成领域里程碑,训练极不稳定
(长短期记忆网络) RNN 改进版,通过门控机制解决长序列依赖,Transformer 出现前的 NLP 主力
(状态空间模型) 2023 年新架构,用状态空间模型替代注意力,推理速度不随序列长度线性增长
(混合专家模型) 每次只激活部分"专家"子网络,参数多但计算少。Mixtral 和 DeepSeek-V2 采用
(残差网络) 通过"跳跃连接"让深层网络可训练,CV 领域里程碑,ResNet-50/101/152
(循环神经网络) 处理序列数据的基础架构,按时间步递归,存在梯度消失问题
(鲁棒优化的BERT) Meta 对 BERT 的优化版,更多数据 + 更大batch + 更长训练,性能显著提升
(Receptance加权键值) 结合 RNN 和 Transformer 优势,推理时是 RNN(快),训练时并行如 Transformer
(小语言模型) 参数 1B-10B 的轻量模型,可在手机/PC 本地运行,Phi、Gemma、Qwen 小尺寸版
(文本到文本迁移Transformer) Google "万物皆Seq2Seq" 模型,将所有 NLP 任务统一为文本到文本格式
(视觉Transformer) 将图像切成 patch 像 token 一样输入 Transformer,证明 Transformer 在视觉也通用
(视觉语言模型) 能同时理解图像和文本的模型,GPT-4V、Gemini Vision、Qwen-VL 等
(随机梯度下降) 经典优化算法,每次用随机小批量数据更新参数,收敛慢但泛化性好
(批归一化) 对每批数据标准化,加速训练收敛、允许更大学习率
(层归一化) 沿特征维度归一化,不依赖 batch size,Transformer 标配
(自动机器学习) 自动搜索最优模型架构和超参数,减少人工调参工作量
(神经架构搜索) AutoML 子领域,用强化学习或进化算法自动设计网络结构
(全分片数据并行) PyTorch 原生分布式策略,类似 ZeRO-3,分片模型参数/梯度/优化器状态
(Long Context Training / RoPE Scaling) 通过位置编码扩展(NTK-aware/YaRN)让模型支持 128K+ 长度,2025 年标配能力
(Curriculum Data Synthesis) 按难度梯度合成训练数据从简单到复杂逐步提升能力,DeepSeek-R1 核心技巧
(Multimodal Pre-training) 统一图像/文本/音频/视频的联合预训练范式,GPT-4o/Gemini 原生多模态的基础
(Process Supervision (PRM)) 对推理每一步而非仅最终结果打奖惩,o1/DeepSeek-R1 推理能力的核心训练方法
(监督微调) 用人工标注的问答数据微调基座模型,让模型学会遵守指令格式
(低秩适配) 只训练少量额外参数(低秩矩阵),冻住原模型权重,极大降低微调成本
(量化低秩适配) LoRA + 4-bit 量化,在单张消费级 GPU 上微调 65B 模型成为可能
(参数高效微调) 微调方法总称:LoRA、Prefix Tuning、Adapter 等,只更新极少参数
(直接偏好优化) RLHF 的简化替代,不需要单独训练奖励模型,直接优化偏好数据,更稳定
(分组相对策略优化) DeepSeek-R1 使用的 RL 方法,组内比较奖励无需价值模型,降低 RL 训练开销
(AI反馈强化学习) 用 AI 模型替代人类标注员提供反馈,可扩展到 RLHF 难以覆盖的领域
(Online DPO / Iterative DPO) 迭代式直接偏好优化:生成样本→标注偏好→更新模型循环,效果远超一次性 DPO
(KTO (Kahneman-Tversky Optimization)) 基于前景理论的偏好优化方法,只需"好/坏"二分类标签无需成对比较,降低标注成本
(ORPO (Odd Ratio Preference Optimization)) 将偏好优化融入 SFT 损失函数的单阶段方法,避免 RLHF 的多阶段复杂性
(SimPO (Simple Preference Optimization)) 无需奖励模型的简化偏好优化,使用平均对数概率作为隐式奖励,简单效果好
(激活感知权重量化) 基于激活值分布保护重要权重通道,4-bit 量化精度损失极小
(KV Cache Quantization) 对 KV Cache 进行 INT8/INT4 量化大幅降低显存占用,长文本推理关键优化
(Continuous Batching / Dynamic Batching) 动态将请求加入批次避免等待最慢请求完成,vLLM/SGLang 标配特性
(Prefix Caching) 缓存共享的系统提示前缀多用户复用减少重复计算,Chatbot 场景提速显著
(Tensor Parallelism (TP)) 将模型单层切分到多张 GPU 同步计算,大模型推理分布式标配
(Pipeline Parallelism (PP)) 将模型各层分配到不同 GPU 按微批次流水线执行,减少 GPU 空闲等待时间
(Memory-Efficient Inference) 包括卸载 offloading、算子融合 fusion 等综合优化策略,让小显卡跑大模型
(Structured Output / Constrained Decoding) 强制模型输出符合 JSON/正则等格式的文本,Agent 调用 API 时必需能力
(大规模多任务语言理解) 57 个学科选择题,衡量模型知识广度。GPT-4 约 86%,是业界标准之一
(整体语言模型评估) Stanford 多维评测框架,覆盖准确率/校准/鲁棒性/公平性/效率/毒性等
(思维链) Few-shot 给出"一步步推理"示例,让 LLM 展示思考过程,数学题正确率翻倍
(上下文学习) 在 Prompt 里给几个示例,模型就能举一反三,无需更新参数
(程序辅助语言模型) 让 LLM 生成代码来解题而非直接推理,将计算外包给 Python 解释器
(推理+行动交替) Thought → Action → Observation 循环,Agent 核心范式,结合推理与工具调用
(思维树) 将推理探索成树形结构,用 BFS/DFS 搜索最佳路径,适合需要规划的任务
(文本切块策略) RAG 中决定如何切分文档:固定大小/语义/递归切分,直接影响检索质量
(纠错式RAG) 引入检索评估器判断结果质量,质量差时自动触发 Web 搜索等补救
(假设文档嵌入) 先让 LLM 生成"假设答案"再用其检索,缩小问题与文档的语义鸿沟
(倒数排名融合) 合并多路检索结果的经典算法,无需调权重,排名倒数求和后重排
(模型上下文协议) Anthropic 推出的 Agent-工具标准化协议,Analog to USB-C for AI integrations
(自主智能体 AI) 让 AI 具备自主感知、推理、规划、行动能力的范式。核心是单 Agent 能自主决定何时调工具、何时查资料、何时换思路。o1/o3、Computer Use、Codex 都是 Agentic AI 的代表
(Agent Cluster / Swarm) 多个专业化 Agent 分工协作的架构模式。各 Agent 各司其职(文案/设计/投放/分析),按协议通信、统一编排。CrewAI/AutoGen/LangGraph 是主流框架。核心价值:1+1>2 的协作效应
(Agentic Workflow) AI Agent 自主规划→执行→观察→反思的完整工作流模式,区别于简单的 LLM 调用
(Multi-Agent Orchestration) 多个专业化 Agent 协作的模式:主管-工人/辩论/层级等,智能体集群核心设计模式
(Plan-and-Solve / Plan-and-Execute) 先完整规划任务步骤再逐步执行的 Agent 模式,适合复杂多步任务
(Tool Use / Function Calling) LLM 根据语义选择并调用外部 API 的能力,GPT-4/Claude 标配 Agent 基础能力
(Human-in-the-loop (HITL)) 关键决策由人类确认后再执行的安全模式,企业级 Agent 部署必备
(Memory Architecture) Agent 记忆分层设计:短期(上下文窗口)/长期(向量数据库)/实体知识(知识图谱)
(Self-Evolving Agent) 能从成功/失败经验中学习并优化自身行为策略的 Agent,Reflexion 延伸方向
(LATS (Language Agent Tree Search)) 结合思维树搜索和反射机制的 Agent 框架,蒙特卡洛树搜索探索最佳行动序列
(CAG (Code Agent Generation)) 代码生成专用 Agent 模式,理解代码库/编写代码/运行测试/修复 bug 自动化流程
(Open Agent Ecosystem) MCP/A2A 等协议推动的跨平台 Agent 互操作标准,类似 USB-C for AI Agents
(机器学习运维) ML 模型的持续集成/部署/监控,类比 DevOps。包含数据/模型/代码三管线
(神经网络处理器) 专为神经网络推理设计的芯片,手机/PC 端侧 AI 推理核心
(张量处理器) Google 定制 AI 加速芯片,Cloud TPU v5p 单 Pod 算力超百 PFlops
(Prompt Injection) 通过恶意输入劫持模型指令链让其忽略原始指令执行攻击者命令,最常见 AI 安全威胁
(Adversarial Robustness) 模型抵抗故意扰动的能力,输入微小变化导致输出错误的风险评估
(XAI (Explainable AI)) 让黑盒模型决策过程可被人类理解的技术方向,监管合规和企业信任基础
(AI Watermarking / SynthID) 在 AI 生成内容中嵌入不可见标记以区分真伪,Google DeepMind SynthID 代表方案
(Constitutional AI (CAI)) Anthropic 提出基于原则集合的对齐方法,AI 自我批评+修订替代人工标注
(Sandbox Execution) Agent 执行代码/命令的隔离环境防止恶意操作影响宿主系统,企业部署安全底线
(机器人流程自动化) 软件机器人自动执行重复性规则任务(填表/导数据),常与 AI Agent 配合使用
(检索增强生成式Agent) RAG + Agent 融合范式,Agent 自主决策检索策略,不是简单的一问一检
(AI生成内容) AI 生成文字/图片/视频/音乐/代码。区别于 UGC 和 PGC 的第三代内容生产方式
(通用人工智能) 能完成任何人类智力任务的 AI。OpenAI 声称 AGI 可能在 2027-2030 年实现
(扩散模型) 逐步加噪再逆向去噪生成图像,Stable Diffusion/DALL-E 3/Sora 的核心技术
(规模定律) 模型性能与参数量/数据量/计算量呈幂律关系,OpenAI 2020 年实证,指导大模型投入决策
(温度参数) 控制模型输出的随机性:越低越确定(代码/事实),越高越有创意(诗歌/故事)
(数据即服务) Data as a Service,云原生数据交付模式,通过 API 提供按需数据服务。2025 年全球市场规模 $249 亿,预计 2030 年达 $619 亿。区别于传统数据仓库,强调即用即付
(OpenAI 代码智能体) OpenAI 云端软件工程智能体(2025重启),基于 o3 架构。能克隆仓库、改代码、跑测试、提 PR——异步自主执行编程任务。最新 GPT-5.3-Codex 是最强 agentic 编程模型
(开源 AI 智能体) 开源本地 AI 智能体框架,由 Peter Steinberger 创建,280K+ GitHub Stars。连接大模型与本地工具,自主执行文件操作、浏览器控制、消息收发等任务
(Kling) 快手推出的AI视频生成大模型,支持文生视频和图生视频,生成最长2分钟1080p视频,中国视频生成领域标杆产品
(Jimeng) 字节跳动推出的AI内容创作平台,支持文生图、文生视频、图生视频,集成豆包大模型能力
(Doubao) 字节跳动旗舰AI对话助手,月活超1.5亿,中国用户量最大的AI应用,支持多模态交互和Agent能力
(Hailuo AI) MiniMax推出的AI对话产品,支持语音克隆和多模态交互,海外版Talkie在海外市场表现亮眼
(Pangu Model) 华为自研大模型系列(技术),覆盖 NLP/CV/科学计算/气象等领域。配套产品:盘古 API 服务、盘乌气象大模型产品。核心优势:国产算力(昇腾芯片)全栈适配,政务/金融/制造等行业深度落地
(Hunyuan Model) 腾讯自研大模型系列(技术),MoE 架构,参数规模万亿级。配套产品:混元助手 App / 腾讯云 MaaS 平台。核心优势:深度整合微信/企业微信/腾讯会议生态,社交和游戏场景有独特数据壁垒
(DeepSeek (深度求索)) 中国 AI 公司 DeepSeek-V3/R1 系列震惊全球,开源最强推理模型极致性价比标杆
(OpenAI o1 / o3 / o4 Series) OpenAI 推理增强模型引入 Test-Time Scaling 思维链推理数学/编程能力飞跃
(GPT-5 / GPT-5.1 / GPT-5.2 / GPT-5.3) OpenAI 2025 年发布的新一代旗舰模型系统多模态原生 Agentic 能力强
(Claude 4 Opus / Sonnet / Haiku) Anthropic 2025 发布的 Claude 4 代模型 Computer Use 能力大幅增强
(Gemini 2.0 / 2.5 Pro / Flash) Google 新一代多模态模型原生多模态长上下文 Agent 能力三合一
(Kimi K2 (月之暗面)) 月之暗面 2025 发布的最新模型 MoE 架构+超长上下文中文能力突出
(Qwen 2.5 / Qwen 3 (通义千问)) 阿里开源模型家族新版本 Qwen3 在多项基准接近闭源顶级水平
(Harvey.ai) AI 法律助手独角兽服务全球顶尖律所垂直行业 AI 商业化标杆
(Character.ai / Pi.ai) AI 情感陪伴产品 Character.ai 月活过亿证明非工具类 AI 产品巨大市场
(OpenAI Agents SDK) OpenAI 官方 Agent 开发框架内置 Agent Loop/Tool Use/状态管理 2025 重点推广
(Vercel AI SDK (AI SDK Core)) Next.js 生态 AI 开发套件提供流式生成/工具调用/RAG 统一抽象前端开发者首选
(Haystack) deepset 开源的 RAG/搜索框架擅长构建问答系统和语义搜索管道
(LiteLLM) 统一 LLM API 代理层一行代码切换 OpenAI/Anthropic/本地模型开发者效率神器
(Promptfoo) LLM 输出质量评测工具批量测试 Prompt 变体回归测试防退化
(DSPy) 斯坦福推出的程序化 Prompt 优化框架用代码定义 Pipeline 自动编译最优 Prompt
(Weights & Biases (W&B)) ML 实验追踪平台记录超参数/指标/模型版本团队协作标配
(Fixie.ai) 开源 Agent 平台类似 LangChain 但更轻量专注快速搭建功能性 Agent
(开放神经网络交换) 微软/ Meta 推动的模型互操作格式,PyTorch→ONNX→TensorRT 跨框架部署
(Arena Hard Auto) 自动化版 Chatbot Arena 用 LLM 裁判评测覆盖 8000+ 问题更新频率高
(AlpacaEval) 单轮指令遵循评测对比模型输出与 GPT-4 参考答案质量轻量快速
(IFEval (Instruction Following Eval)) 严格测试模型是否遵守格式/长度/关键词等可验证指令衡量可控性
(MathBench) 中文数学推理评测覆盖小学到竞赛级别中文模型数学能力重要标尺
(CRP (Code Reading & Processing) Eval) 代码阅读理解评测衡量模型读懂现有代码库并进行修改的能力
(MultiPL-E) 多语言编程评测扩展 HumanEval 到 20+ 编程语言衡量泛化能力
(World Models) AI 构建内部模拟环境来理解和预测物理世界的方向被视为通往 AGI 可能路径
(Embodied AI) AI 与物理世界交互的能力机器人控制/操作物体/空间导航下一代 AI 热点
(Test-Time Compute (TTC) Optimization) 推理时动态决定投入多少计算量简单问题少算复杂问题多算 o1 核心创新
(Data Flywheel) 用户使用数据反哺模型优化的正向循环 AI 产品建立壁垒的核心机制
(SLM Collaboration) 多个小模型分工协作完成复杂任务替代单个大模型降本增效新范式
(Edge AI) 在设备端(手机/IoT/摄像头)本地运行 AI 模型低延迟+隐私保护部署趋势
(Green AI) 关注 AI 训练和推理能耗与碳排放高效架构(SLM/Mamba)成为研究热点
(Sovereign AI) 国家/地区层面 AI 自主可控能力自建算力/自研模型/自有数据地缘政治新概念
(Agent-to-Agent) Google 提出的 Agent 间通信协议,让不同框架开发的 Agent 互操作
(氛围编程) 2025 年由 Andrej Karpathy 提出的概念,用自然语言描述需求让 AI 写代码,人类只需"感受氛围"而非逐行编写。Claude Code/Cursor/Replit Agent 推动了这个趋势
(欧盟人工智能法案) 全球首部全面AI监管法规,2024年通过,按风险等级分类监管(不可接受/高风险/有限风险/最小风险),违者最高罚全球营收7%
(模型卡片) Google提出的模型透明度文档标准,记录模型用途、性能、局限、伦理考量,已成为行业发布标配
(系统卡片) 比Model Card更全面的系统级安全文档,OpenAI在GPT-4发布时首推,覆盖整个系统而非仅模型
(负责任AI) 确保AI公平、可解释、隐私保护、安全可靠的综合框架,Google/Microsoft/OpenAI均设专门团队
(Fairness Metrics) 衡量模型在不同人群间表现差异的指标:Demographic Parity、Equalized Odds、Equal Opportunity等
(Jailbreak) 通过精心构造Prompt绕过模型安全限制(如DAN/角色扮演),各模型厂持续升级防护
(Red Teaming) 模拟攻击者测试模型安全性,OpenAI/Anthropic等在新模型发布前必经流程,涵盖偏见/毒性/越狱等多维度
(Superalignment) 确保超越人类智能的AI系统仍可控可对齐,OpenAI投入20%算力研究此问题,Ilya Sutskever创立SSI专注此方向
(AI Safety Summit) 2023年英国首届全球AI安全峰会,中美等28国签署《布莱切利宣言》,标志AI安全进入全球治理议程
(Bias Mitigation) 预处理(数据重采样)、处理中(正则化约束)、后处理(输出校准)三阶段消除AI偏见的系统工程
(Copyright & AI) AI训练数据版权问题:NYT诉OpenAI、Getty诉Stability AI等标志性案件,将决定AI产业的合法性边界
(AI Audit) 第三方独立审查AI系统的合规性、公平性、安全性,正在成为企业采购AI的标配流程
(Data Curation) 从海量原始数据中筛选高质量训练数据的过程,Phi系列模型证明数据质量远比数量重要
(Data Contamination) 训练数据中混入了评测集内容,导致评测分数虚高。业界争议焦点:到底多大程度影响了基准公信力?
(Synthetic Data Generation) 用AI模型生成训练数据,解决高质量数据枯竭。o1/DeepSeek-R1重度依赖合成数据,但需警惕Model Collapse
(Data Labeling) 人工/半自动为训练数据添加标签,SFT和RLHF必需。Scale AI是该领域龙头,中国有海天瑞声等
(Deduplication) 消除训练数据中的重复内容,提升数据效率、降低记忆风险。MinHash/SimHash是常用算法
(Data Mixture) 预训练时不同来源数据的比例设计(代码vs网页vs书籍vs论文),是各家模型厂的"秘方"
(Quality Filtering) 用分类器/困惑度/规则等方法过滤低质量网页内容,预训练数据清洗的关键步骤
(Active Learning) 模型主动选择最有价值样本让人工标注,以最少标注成本获得最大性能提升
(Data Augmentation) 通过变换/改写/翻译等扩充训练数据,提升模型泛化能力。在低资源场景尤其重要
(Human Annotation) 人类标注员为训练数据打标签/写参考答案/排序偏好,SFT和RLHF的底层支撑,全球产业规模数十亿美元
(PII Removal) 从训练数据中去除姓名/电话/地址等个人信息,GDPR等法规要求,也是数据泄露风险防控
(Swarm Intelligence) 多个简单Agent通过局部交互涌现出复杂智能行为,借鉴蚂蚁/蜂群等自然系统,OpenAI Swarm框架探索此方向
(Agent Role Design) 为每个Agent定义专业角色(CEO/研究员/工程师/分析师),赋予不同的知识、工具和决策权限
(Agent Communication) Agent间交换信息的方式:结构化JSON/自然语言对话/黑板模式。MCP和A2A是标准化协议代表
(Hierarchical Agents) "主管-工人"架构:上层Agent分解任务分配给下层Agent执行,汇总结果。CrewAI/LangGraph支持此模式
(Debate Agents) 多个Agent就同一问题从不同角度辩论,最终综合多方观点得出更可靠结论,减少单一模型偏见
(Agent Observability) 追踪多Agent系统的决策链路、工具调用、协作过程,用于调试和审计。LangSmith/Weave等工具支持
(Agent Safety) 限制Agent的权限范围(不能删库/不能转账/不能发邮件给全员),HITL+沙箱+权限分级是核心手段
(Agent Evaluation) 评估Agent完成复杂任务的能力:GAIA/WebArena/SWE-bench等基准,比单轮对话评测难得多
(Token经济学) AI API按Token计费的完整商业逻辑:输入/输出定价、批量折扣、长文本溢价、成本估算模型
(Cost per FLOP) 衡量AI训练/推理效率的核心指标,受GPU价格、电力成本、利用率影响。DeepSeek以极低FLOP成本震惊业界
(Inference Economics) 分析推理成本结构:GPU租赁、KV Cache显存、批处理效率、模型压缩ROI,决定AI产品能否盈利
(总拥有成本) GPU全生命周期成本:采购+电力+冷却+运维+折旧。H100三年TCO约$30-40K,是AI预算的核心
(Model Arbitrage) 根据任务复杂度动态路由到不同成本模型:简单任务用廉价模型,复杂任务用顶级模型,优化整体成本
(Free Tier Economics) AI产品免费层的成本考量:ChatGPT免费用户单次对话成本约$0.01-0.03,日活1亿意味着每天百万美元推理成本
(AI Startup Unit Economics) AI创业公司关键指标:推理成本/用户、毛利率(通常30-70%)、客户获取成本(CAC)、用户留存率
(Hardware Subsidy) 云厂商以成本价甚至亏损提供AI推理服务,通过锁定客户在自家云生态中的其他消费来盈利
(Supervised Learning) 用带标签的数据训练模型,学习输入到输出的映射。分类和回归是两大任务,是最基础的ML范式
(Unsupervised Learning) 从无标签数据中发现隐藏结构,聚类、降维、异常检测是典型任务
(Semi-supervised Learning) 结合少量标注数据和大量无标注数据训练,标注成本高时常用
(Reinforcement Learning / RL) 智能体通过与环境交互获得奖励/惩罚来学习最优策略,AlphaGo/RLHF均基于此
(Classification) 预测离散类别标签:垃圾邮件检测、情感分析、图像识别都是分类任务
(Regression) 预测连续数值:房价预测、销量预测、股价预测都是回归任务
(Clustering) 无监督地将相似样本归为一类,K-Means/DBSCAN/层次聚类是经典算法
(Dimensionality Reduction) 将高维数据映射到低维空间同时保留主要信息,PCA/t-SNE/UMAP是常用方法
(Overfitting) 模型在训练数据上表现很好但在新数据上表现差,"死记硬背"而非真正学习
(Underfitting) 模型太简单连训练数据都学不好,偏差太大
(Train/Val/Test Split) 数据三划分:训练集学习参数、验证集调超参、测试集最终评估,典型比例6:2:2
(Cross Validation) K折交叉验证将数据分成K份轮流做验证,更可靠地评估模型性能
(Gradient Descent) 优化算法基础:沿着损失函数梯度反方向更新参数,逐步找到最小值
(Learning Rate) 梯度下降每步更新的步长,太大震荡不收敛、太小收敛慢,是最重要的超参之一
(Regularization) 防止过拟合的技术总称:L1/L2正则化、Dropout、Early Stopping、权重衰减
(Loss Function) 衡量模型预测与真实值差距的函数,训练的目标就是最小化损失值
(Cross Entropy Loss) 分类任务标配损失函数,衡量两个概率分布的差异,LLM训练默认使用
(MSE / L2 Loss) 回归任务标配损失,预测值与真实值差的平方平均,对大误差惩罚重
(MAE / L1 Loss) 预测值与真实值差的绝对值平均,对异常值更鲁棒
(Activation Function) 为神经网络引入非线性,没有激活函数多层网络等价于单层线性变换
(Rectified Linear Unit) f(x)=max(0,x),最常用的激活函数,计算简单缓解梯度消失,但有"死亡ReLU"问题
(Gaussian Error Linear Unit) Transformer标配激活函数,BERT/GPT均使用,比ReLU更平滑性能更好
(Self-Attention) 序列中每个元素关注所有其他元素并计算加权表示,Transformer的核心创新
(Multi-Head Attention / MHA) 将Q/K/V投影到多个子空间并行计算注意力,捕获不同类型的依赖关系
(Multi-Query Attention / MQA) 所有头共享同一份K/V,只有Q是多头,大幅减少KV Cache显存,推理加速
(Grouped-Query Attention / GQA) MHA和MQA的折中:K/V按组共享,LLaMA 2/Claude/GPT-3.5使用,平衡效果与速度
(MLA / Multi-head Latent Attention) DeepSeek提出的低秩压缩注意力,KV Cache压缩90%以上,大幅降低推理成本
(Sliding Window Attention) 每个token只关注前后固定窗口大小的token,O(n)复杂度,Mistral/Longformer使用
(Cross Attention) Q来自一个序列,K/V来自另一个序列,用于编码器-解码器架构和多模态融合
(Causal Mask / Look-ahead Mask) Decoder中屏蔽未来位置,确保预测第t个词时只能看到1..t-1的词
(Query / Key / Value) 注意力机制三要素:Query(查询)、Key(键)、Value(值),类比信息检索系统
(Positional Encoding) Transformer本身不感知位置顺序,需要额外注入位置信息,有正弦/学习式/RoPE等方式
(旋转位置编码) 通过旋转矩阵编码相对位置,LLaMA/Qwen等主流开源模型标配,外推性好
(线性偏置注意力) 不用位置嵌入,直接给注意力分数加与距离成反比的惩罚,长文本外推能力强
(Sinusoidal Position Encoding) 原版Transformer使用,用不同频率的sin/cos函数编码位置,有一定外推能力
(Yet another RoPE extensioN) 改进的RoPE外推方法,结合NTK和注意力分布缩放,长上下文精度损失更小
(Llama / Llama 2 / Llama 3 / Llama 4) Meta开源大模型系列,Llama 1(2023)开启开源LLM浪潮,Llama 3/4性能追平闭源模型,是开源生态基石
(Mistral 7B / Mixtral 8x7B / Mistral Large) 法国Mistral AI出品,小参数高性能代表,Mixtral采用MoE架构,开源模型第一梯队
(通义千问 Qwen / Qwen1.5 / Qwen2 / Qwen2.5 / Qwen3) 阿里开源模型家族,覆盖0.5B到72B全尺寸,多模态/代码/数学全支持,中文能力顶尖
(DeepSeek-V2 / V3 / R1 / Coder) 深度求索出品,V3/R1以极致性价比震惊全球,R1推理能力匹敌o1,DeepSeek-Coder是最强开源代码模型
(零一万物 Yi) 李开复创办的零一万物出品,基于Llama架构改进,中文能力优秀,有6B/34B等尺寸
(智谱AI) 清华技术背景,智谱AI出品,GLM-4是国内首批闭源API之一,也开源了ChatGLM系列
(面壁智能) 面壁智能端侧小模型系列,2B/4B参数媲美7B/13B模型,手机端可流畅运行
(Cohere) Cohere开源的RAG优化模型,长上下文+原生工具调用,企业级RAG场景常用
(TII阿联酋) 阿联酋技术创新研究所出品,Falcon 40B/180B曾是最强开源,推动了开源LLM发展
(书生·浦语) 上海AI实验室/商汤等联合出品,InternLM2性能强劲,配套开源工具链完整
(百川智能) 王小川创办百川智能出品,Baichuan2系列开源,中文对话体验优秀
(智源) 智源研究院悟道团队的开源模型,支持中英文,许可协议宽松
(Blackwell架构) 2024年发布的Blackwell新一代架构,B200性能比H100提升数倍,AI训练新标杆
(Ascend 910B) 华为自研AI训练芯片,910B性能接近A100,国产替代主力,支持CANN软件栈
(Compute Unified Device Architecture) NVIDIA GPU并行计算平台和编程模型,CUDA生态是NVIDIA最深的护城河,AMD/华为难以替代
(高带宽内存) 3D堆叠高带宽显存,HBM3/HBM3e是AI GPU标配,带宽是普通GDDR的数倍
(现场可编程门阵列) 可重构硬件芯片,低延迟推理场景使用,比GPU灵活比ASIC快
(专用集成电路) 为特定AI任务定制的芯片,TPU/NPU都是ASIC,效率高但灵活性差
(You Only Look Once) 最流行的实时目标检测算法,YOLOv8/v9/v10/v11持续迭代,速度快精度高
(Segment Anything Model) Meta 2023年发布的通用图像分割模型,点击/框选即可分割任意物体,CV领域"GPT时刻"
(Object Detection) 定位图像中物体位置并分类,YOLO/Faster R-CNN/DETR是代表算法
(Segmentation) 语义分割(类别)、实例分割(个体)、全景分割(两者结合),CV核心任务之一
(光学字符识别) 识别图像中的文字,PaddleOCR/Tesseract是常用工具,LLM出现后能力大幅提升
(Face Recognition) 识别人脸身份,FaceNet/ArcFace是经典方法,中国技术全球领先
(Image Captioning) 为图片生成文字描述,多模态模型(GPT-4V/Gemini)已远超传统方法
(Depth Estimation) 从单目/双目图像估计场景深度,自动驾驶和3D重建关键技术
(Pose Estimation) 识别人体关键点位置(肩膀/手肘/膝盖等),动作捕捉和健身应用基础
(Detection Transformer) Facebook提出的Transformer目标检测,端到端无需NMS后处理,颠覆了两阶段检测范式
(Contrastive Language-Image Pretraining) OpenAI零样本图像分类模型,图文对比学习,是Stable Diffusion/DALL·E的文本编码器基础
(图像生成LoRA) Stable Diffusion社区的LoRA模型,用于学习特定人物/风格/物体,C站(Civitai)有海量资源
(自动语音识别) 将语音转文字,Whisper是当前开源标杆,中文有Paraformer/Conformer等方案
(文本转语音) 将文字转为自然语音,VALL-E/Bark/ChatTTS/Fish Speech等开源模型效果逼真
(Voice Cloning) 几秒音频样本即可克隆一个人的声音,ElevenLabs/Fish Speech技术领先,伦理争议大
(Speech-to-Speech) 端到端语音对话,无需先ASR→LLM→TTS pipeline,GPT-4o Voice/Free Willy 2等
(Music Generation) Suno/Udio可生成完整歌曲,MusicGen是Meta开源方案
(Audio Diffusion) 用扩散模型生成音频,Stable Audio/AudioLDM是代表
(Native Multimodal) GPT-4o/Gemini等新一代模型,文本/图像/音频/视频从底层统一token化处理,而非拼贴式
(Video Understanding) 理解长视频内容、回答问题、总结摘要,GPT-4o/Gemini 1.5 Pro支持1-2小时视频输入
(Any-to-Any) GPT-4o/Gemini支持语音/文字/图片任意输入输出组合,人机交互新范式
(去噪扩散概率模型) 扩散模型奠基论文(2020),逐步加噪再逐步去噪生成图像,训练稳定但采样慢
(去噪扩散隐式模型) DDPM的加速采样变体,几十步即可生成,确定性采样可复现结果
(Latent Diffusion Model) Stable Diffusion核心:在压缩后的隐空间而非像素空间做扩散,效率提升数十倍
(Stable Diffusion XL) Stable Diffusion升级版,1024分辨率画质大幅提升,是开源图像生成主流底座
(Black Forest Labs) Stable Diffusion原班人马新公司出品,Flux.1 [schnell/dev]是当前最强开源文生图模型
(无分类器引导) 扩散模型采样技术,通过条件/无条件预测差值控制图像与文本的对齐程度
(Sampler / Scheduler) 扩散模型去噪的数值方法:Euler/DPM++/DDIM/PNDM等,影响生成速度和质量
(Inpainting / Outpainting) Inpainting修改图片局部,Outpainting向外扩展图片,AI图像编辑常用功能
(一致性模型) Latent Consistency Models,4-8步即可生成高质量图像,实时AI绘画成为可能
(近端策略优化) RLHF中的核心RL算法,训练稳定易调参,OpenAI默认策略梯度算法
(Policy Gradient) 直接优化策略(行为)的RL方法家族,PPO/TRPO/A2C都属于此类
(马尔可夫决策过程) 强化学习数学框架:状态/动作/转移概率/奖励,未来只依赖当前状态
(Exploration vs Exploitation) RL核心权衡:探索未知动作获取更多信息 vs 利用已知最优动作获取最大奖励
(Reward Model / RM) RLHF中训练来预测人类偏好的模型,给LLM输出打分,引导LLM朝人类满意方向优化
(Reward Hacking) 模型找到奖励函数漏洞获得高分但没完成真正目标,是RLHF和AI安全的已知问题
(Credit Assignment) 确定哪些行为导致了最终奖励,长序列任务中尤其困难
(Chain-of-Thought / CoT) 让模型"一步步思考",显著提升数学/推理题正确率,"Let's think step by step"
(Self-Consistency) 多次采样CoT推理路径取多数答案,提升推理稳定性和正确率
(Tree of Thoughts / ToT) 在树结构中探索多条推理路径,支持回溯和剪枝,适合复杂规划问题
(Graph of Thoughts / GoT) 将推理过程组织为图结构而非树/链,支持聚合和循环,更强的推理能力
(Role Prompting) "你是一个XX领域专家...",设定身份后模型输出质量和专业性显著提升
(Step-Back Prompting) 让模型先回答更高层次的抽象问题,再用抽象答案指导具体问题解决
(Dynamic Prompting) 根据问题类型动态选择不同的Prompt模板和示例,而非一个固定Prompt
(Text Generation Inference) Hugging Face生产级LLM推理服务,支持连续批处理/量化/流式输出
(AI Drug Discovery) 用AI加速靶点发现、分子设计、临床试验,已诞生多家上市公司
(AI Weather Forecasting) 盘古气象/GraphCast用AI做天气预报,速度比传统数值方法快数千倍,准确率更高
(Autonomous Driving) L2-L5分级,Tesla FSD/Waymo/百度萝卜快跑,端到端自动驾驶是新趋势
(Robotics) 具身智能载体,Figure/Optimus/Unitree,大模型赋能机器人理解指令和规划动作
(AI Coding) Copilot/Cursor/Claude Code/Devin,AI编程是目前AI落地最成功场景,效率提升显著
(DashScope) 阿里通义千问API平台,Qwen系列+开源模型托管,国内开发者常用
(Qianfan) 百度文心大模型API平台,兼容OpenAI接口,企业级服务能力
(模型即服务) Model-as-a-Service,将AI模型作为云服务提供,按使用量计费,是AI时代的云计算新形态
(Open Weights) 模型权重可下载使用但不一定是OSI认证的"开源",许多大模型是open-weight但使用有限制
(Best Matching 25) 经典关键词检索算法,TF-IDF改进版,词频+文档长度归一化,混合搜索必备
(Reranker) 初筛后用更强的交叉编码器重新排序文档,提升召回精度,bge-reranker/Cohere Rerank常用
(Hierarchical Chunking) 小块检索+大块上下文:先检小片段定位,再取完整段落给LLM,兼顾精度和完整语境
(Sentence Window Retrieval) 检索单句后扩展前后n句作为上下文,避免切块切断语义
(Parent Document Retriever) 小块索引检索但返回大块文档,类似分层切块的一种实现
(Multi-Query Retrieval) 让LLM把一个问题改写成多个角度的查询,多路检索合并结果,提高召回率
(递归摘要树检索) 将文档聚类递归摘要构建树结构索引,支持不同抽象层次的问答
(Fusion Retrieval) 混合搜索+RRF重排,综合多种检索算法结果,效果通常优于单一检索
(上下文化BERT late interaction) Token级 late interaction 检索模型,速度接近词法匹配精度接近交叉编码器
(Reasoning + Acting) Thought(思考)→Action(行动)→Observation(观察)循环,Agent核心推理框架
(Task Routing) 将用户请求分类路由到专门Agent/模型,简单问题用小模型省成本
(Sub-Agent) 主Agent调用专门化的子Agent完成子任务,每个子Agent有自己的工具和Prompt
(Task Completion Rate) Agent成功完成任务的比例,是衡量Agent系统效果的核心指标
(State Management) Agent运行过程中维护对话历史、中间结果、任务进度,LangGraph内置状态图
(Human-in-the-loop) 关键决策点暂停等待人类确认,高风险场景(金融/医疗)必备安全机制
(Tool Schema) 用JSON Schema描述工具参数,LLM选择工具并生成参数,Function Calling的基础
(Parallel Tool Calling) 一次调用多个工具并行执行,减少等待轮次,OpenAI/Anthropic API均支持
(Code Interpreter / Advanced Data Analysis) 沙箱中执行LLM生成的Python代码,用于计算/数据分析/文件处理,ChatGPT Plus内置
(Test-Time Compute Scaling) o1/R1核心思路:推理时投入更多计算(长思维链/多次尝试)提升答案质量,而非仅堆训练算力
(Reasoning Model) o1/R1这类慢思考模型,通过强化学习训练长思维链推理能力,数学/编程/科学题显著提升
(Neuro-Symbolic Methods) 结合神经网络感知能力和符号系统逻辑推理能力,减少幻觉提升可解释性
(Mixture-of-Depths / MoD) 不同token使用不同网络深度,简单token少用层,动态计算提升效率
(Long Context / 1M+ tokens) Gemini 1.5 Pro支持100万-200万token,可一次处理整本书/代码库/几小时视频
(Context Engineering) Prompt工程升级版:精心设计上下文(系统提示/RAG/工具定义/记忆)最大化模型性能
使用建议
以上 800+ 词不需要一次性记住。浅层标签的词在讨论中听到能接上话即可;中层标签的词理解原理后能分析技术路线差异;深层标签的词是需要系统学习的大领域。建议把此页面加入书签,遇到陌生缩写随时来查。左侧搜索框支持快速检索(快捷键 Ctrl+K / ⌘+K),输入任意术语即可定位。
上游:芯片、算力与基础设施
成本占比最大、壁垒最高的一层AI 训练芯片
大模型训练的核心硬件。英伟达 H100(全球 AI 训练芯片约 80% 份额)是最主流选择。H200/B200 新一代芯片算力持续翻倍。国产替代:华为昇腾 910B。
云计算平台
提供弹性 GPU 集群,按小时租赁。企业不需要一次性购买几千块 GPU,可以在云上按需使用。AWS、Azure、阿里云、华为云的 AI 业务都是增长最快板块。
AI 芯片设计 IP & EDA
芯片设计所需的核心 IP 和工具软件。ARM 提供芯片架构授权,Cadence/Synopsys 提供芯片设计 EDA 工具。随着自研 AI 芯片趋势,该层价值快速提升。
AI 数据中心
大规模 GPU 集群需要专门的供电、散热、网络设施。一个万卡 H100 集群功耗相当于一个小型发电站。液冷散热成为标配,电力供应成为关键瓶颈。
总架构图:AI 产业链上游 — 从沙子到算力
上游的核心是把原材料变成可用的计算能力。芯片设计 → 晶圆制造 → 封装测试 → 服务器集成 → 数据中心部署。
EDA工具
CadenceSynopsys
芯片设计
NVIDIA/华为ARM IP
晶圆制造
台积电/三星7nm→3nm
GPU/加速卡
H100/B200昇腾910B
服务器集成
超微/浪潮8-GPU节点
智算中心
万卡集群液冷供电
中游:模型层与开发工具
技术创新最密集的一层通用基础大模型
用全网数据训练的"全能型"模型,是所有下游应用的底座。训练一次成本数千万到数亿美元。全球有能力训练通用大模型的公司不超过 20 家。
模型 API 服务
把大模型包装成 API,按调用量计费。让任何开发者不需要 GPU 就能用上大模型。价格战最激烈的赛道:DeepSeek 价格仅为 GPT-4o 的 1/50。
AI 开发平台与框架
提供工具链让开发者构建 AI 应用:Prompt 管理、RAG 编排、Agent 框架、评测体系。类比于"AI 时代的操作系统",做平台的人赚生态的钱。
向量数据库与数据平台
RAG 架构的基础设施,存储和检索向量化的知识。传统数据库巨头和新锐创业公司都在抢这个赛道。
垂直/行业大模型
基于通用大模型,用行业数据微调的专用模型。医疗、法律、金融、编程等垂直领域。壁垒在于行业数据的获取和标注质量。
AI 安全与对齐
确保模型输出安全、合规、不产生有害内容。随着各国 AI 监管法规出台(欧盟 AI Act 等),安全合规成为模型上线的刚需环节。
总架构图:AI 产业链中游 — 从模型训练到能力输出
中游做一件事:把算力变成可调用的"智能"。基础模型 → 微调 → API 服务 → 平台工具 → 行业垂直模型。
通用基础大模型
全网数据训练 · 数亿美金成本 · 全行业底座
模型 API 服务
按Token计费
价格战主战场
开发平台与框架
LangChain · Dify
扣子 · 百炼
安全与对齐
内容过滤 · 越狱防护
欧盟AI Act合规
垂直行业大模型
医疗 · 法律 · 金融 · 编程 · 教育 · 制造
下游:应用层与解决方案
变现最直接、模式最成熟的一层对话与搜索
AI 对话助手和智能搜索引擎。ChatGPT 是现象级产品(2 个月破 1 亿用户)。传统搜索正在被 AI 搜索重构:Perplexity 的崛起让 Google 感受到了真正的威胁。
内容生成 AIGC
AI 生成文字、图片、视频、音乐。广告素材、电商商品图、影视特效等场景需求巨大。Midjourney 年收入超 3 亿美元,Sora 正在颠覆视频制作行业。
代码智能体
AI 辅助编程、代码审查、自动测试。GitHub Copilot 是最成功的 AI 应用之一,有研究表明提升程序员效率 55%。这也是我们 OPC 的切入口方向。
智能客服
用大模型替代传统关键词匹配的客服机器人。能真正理解客户意图,处理复杂退款、投诉场景。工单自动化 + 情绪识别 + 知识库 RAG。
数据分析智能体
用户用自然语言问数据问题,Agent 自动写 SQL 分析。降低数据分析门槛从"需要会写代码"到"会说人话就行"。
营销智能体
AI 自动生成广告文案、优化投放策略、做客户分群洞察。营销是 AI 落地最快的场景之一,因为 ROI 最直接可衡量。
垂直行业应用
医疗 AI 辅助诊断、法律文书自动起草、金融风控建模、教育个性化辅导、制造缺陷检测。每个垂直行业都有百亿级别的 AI 应用市场空间。
多智能体协作平台
让多个 AI Agent 分工协作,完成复杂的端到端任务。比如:一个营销团队可以有文案 Agent + 设计 Agent + 投放 Agent + 分析 Agent。智能体集群是未来 3-5 年的核心方向。
总架构图:AI 产业全链路 — 上游 → 中游 → 下游
三层的价值分配:上游赚硬件的钱(毛利高、壁垒厚),中游赚平台和 API 的钱(规模效应),下游赚解决方案和应用的钱(离用户最近、创新最快)。
上游:算力层
芯片 · 云平台 · 数据中心
英伟达 · 华为 · AWS
毛利 60-80%
中游:模型与平台层
大模型 · API · 开发框架
OpenAI · DeepSeek · LangChain
毛利 30-70%
对话 · 搜索
ChatGPT · Kimi
AIGC 内容
Midjourney · Sora
代码 Agent
Copilot · Cursor
智能客服
Zendesk AI
数据分析
自然语言→SQL
营销 Agent
文案 · 投放 · 洞察
垂直行业
医疗 · 法律 · 金融
多Agent协作
AutoGen · CrewAI
OpenAI 美国
| 维度 | 详情 |
|---|---|
| 旗舰产品 | ChatGPT、GPT-4o(文字+图片+语音+视频全模态) |
| 2024 年收入 | 年化约 30-40 亿美元,ChatGPT Plus 订阅 + API 调用 |
| 中国对标 | 文心一言、豆包(综合能力);DeepSeek(技术深度) |
Anthropic 美国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | Claude 3.5 Opus / Sonnet,200K 上下文窗口 |
| 2024 年收入 | 数亿美元级别,通过 AWS 渠道快速增长 |
| 差异化优势 | 安全优先理念,Claude.ai 写作质量被公认业界最优 |
Google DeepMind 美国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | Gemini 2.5 Pro,原生多模态,支持百万级上下文 |
| 独家资产 | 海量自有数据(YouTube、搜索、Gmail) |
| 分发渠道 | 所有 Google 产品内置 + Android 系统预装 |
Meta AI(Facebook)美国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | Llama 4(开源),主打部署性价比 |
| 战略意图 | 开源以商品化市场、避免被 OpenAI 锁定;用 AI 优化内容推荐 |
| 生态影响 | 基于 Llama 微调的模型占据开源榜单主导地位 |
其他重要海外玩家
| 公司 | 市场定位 | 核心产品 |
|---|---|---|
| 微软(Microsoft) | AI 最大受益者。Copilot 深度嵌入 Office + GitHub,拥有 GPT 独家授权 | Copilot、Azure AI |
| 苹果(Apple) | 端侧 AI 之王。Apple Intelligence 让大模型在 iPhone 本地运行 | Apple Intelligence |
| xAI(马斯克) | 激进闯入者。Grok 模型系列,122 天建成超级数据中心 | Grok |
| Mistral AI | 欧洲 AI 冠军。法语+英语双语优势,开源路线 | Mistral Large |
| 英伟达(NVIDIA) | 上游之王。市值约 2.7 万亿美元,垄断 80%+ AI 训练 GPU 市场 | A100、H100、B200 GPU |
| Perplexity AI | AI搜索标杆。答案附带引用来源,年收入超$1亿,被称为"Google杀手" | Perplexity Pro |
| Cohere | 加拿大企业级LLM。专注RAG和Embedding,服务企业客户,不与OpenAI正面竞争 | Command R+ |
| ElevenLabs | AI语音合成霸主。语音克隆技术行业领先,支持29种语言,估值超$30亿 | ElevenLabs TTS |
| Stability AI | 开源图像生成先驱。Stable Diffusion系列,面临商业化挑战但生态影响力巨大 | Stable Diffusion 3 |
| Aleph Alpha | 德国AI旗舰。欧洲主权AI代表,强调数据主权和透明性,获政府数亿欧元订单 | Luminous系列 |
DeepSeek(深度求索)中国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | DeepSeek-V3(GPT-4 级别,低成本);R1(推理模型) |
| 核心优势 | 极致性价比;全部开源;2025-2026 年全球轰动 |
| 背景 | 母公司:幻方量化(量化对冲基金) |
字节跳动(豆包)中国
| 维度 | 详情 |
|---|---|
| 旗舰产品 | 豆包-Pro 2.0;豆包 App 月活 1.5 亿+(中国第一 AI 应用) |
| 核心优势 | 抖音流量分发能力;视觉和 3D 能力突出 |
智谱 AI(清华系)中国
| 维度 | 详情 |
|---|---|
| 旗舰模型 | GLM-4 / ChatGLM;企业 PMF 门户;AutoGLM(Agent 产品) |
| 核心优势 | 全栈能力;企业销售能力强;AutoGLM 智能体布局领先 |
其他重要中国玩家
| 公司 | 市场定位 | 核心产品 |
|---|---|---|
| Kimi(月之暗面) | 长上下文先驱:1000 万 token 上下文窗口。中国估值最高 AI 独角兽 | Kimi 智能助手 |
| 文心一言(百度) | AI 全栈布局最深;RAG + 企业服务能力强 | 文心一言、文心大模型 API |
| 通义千问(阿里) | 模型规模最大;Qwen 系列有大量细分微调变体 | 通义千问系列(阿里云) |
| 混元(腾讯) | 社交+游戏场景融合;企业微信深度集成 | 腾讯混元大模型(腾讯云) |
| 百川智能 | 前搜狗CEO王小川创立,专注AI医生和AI顾问等垂直场景 | 百川大模型系列 |
| 阶跃星辰 | 前微软全球副总裁姜大昕创立,多模态能力突出 | Step系列模型 |
| 面壁智能 | 清华系端侧AI先驱,MiniCPM系列在手机端高效运行 | MiniCPM |
| 智源研究院 | 北京AI非营利研究机构,发布悟道大模型,中国AI研究重镇 | 悟道、FlagAlpha |
| 深势科技 | AI for Science标杆,分子动力学模拟,药物和材料设计 | DeepMD、Uni-Mol |
闭源阵营
- OpenAI GPT-4o:性能第一梯队;API 定价最高
- Anthropic Claude:安全第一;长文写作最优
- Google Gemini:深度融合 Google 全家桶生态
- 优势:性能最强、企业级安全保障、免运维
- 劣势:成本最高、供应商锁定、数据需出企业
开源阵营
- Meta Llama 4:生态最成熟、全球部署量最大
- DeepSeek V3/R1:性价比之王、推理能力有优势
- Mistral Large:欧洲主权 AI 的代表
- 优势:成本低、可定制、数据主权可控、自由 Fork
- 劣势:需自建运维团队、能力约闭源的 80-85%
关键趋势:开源模型正在吃掉 SaaS 市场的大头
闭源模型的溢价空间仅限于前 5% 的最关键应用场景。对于 90%+ 的企业场景,开源模型(Llama、DeepSeek)已经足够好用且成本仅为闭源的十分之一到二十分之一。这个格局和十年前云计算 vs 开源数据库的竞争逻辑如出一辙。
SaaS 订阅
按月/年向用户或组织收取 AI 增强服务的订阅费。
单位经济学:人效成本碾压,订阅费通常仅为替代人力的 1/20
API 按量计费
按每百万 token 收费,用量越大付费越多。
毛利率:30-70%,完全取决于 GPU 采购成本的议价能力
私有化部署
一次性部署费 + 年度维保费。面向金融、政务、军工等监管要求高的场景。
利润率最高:80%+ 毛利率,大企业倾向于本地安装
增值服务(Freemium)
基础功能免费,高级功能(更高质量、更快速度、更多次数)收费。
获客成本趋零;考验免费到付费的转化精度
数据飞轮增值
客户使用产生数据 → 优化模型 → 服务更好 → 更多客户。
最难实现;合规审计常让飞轮梦碎
模型即服务(MaaS)
把微调好的模型当产品卖,模型市场作为分发渠道。
只有在客户品牌绑定足够深时才成立
2025-2026 年真实行业变化
API 价格战白热化:DeepSeek 用极低成本证明了模型能力可以"白菜价"。SaaS+AI 模式已验证:现有 SaaS 加 AI 功能提升 ARPU 30-50%。私有化部署是利润中心:中国企业特别是国企和政府对本地 AI 部署需求巨大。垂直 AI Agent 毛利率 70%+,可能是对创业公司最有吸引力的新商业模式。
AI 创业公司成本结构
- GPU / 算力(40-60%):最大单项成本,训练+推理合计
- 工程师团队(25-35%):AI 研究员 + ML 工程师 + 基础设施团队
- 数据与标注(5-15%):数据采购、标注、清洗
- 基础设施(5-10%):云服务、监控、安全
- 销售与商务(5-10%):企业销售周期平均 6-9 个月
AI SaaS 单位经济学
- 年度客单价(ARPU):消费者 $120-$240;企业每座 $1,200-$12,000
- 单用户月 GPU 成本:消费者 $0.5-$3;企业 $5-$30
- 毛利率:消费者 60-85%;企业 50-70%;私有部署 80%+
- 关键 KPI:单次 API 调用的推理 GPU 成本 × 24 小时 GPU 利用率
- 流失率:消费者月流失 3-6%;企业年合同月流失 1-4%
定价核心策略
GPU 采购是黄金门票:大额云承诺(1 亿美元+)才能拿到最优 GPU 价格。推理优化是利润之源:量化压缩、缓存命中、提示词效率,每优化 1% 都是纯利润。企业销售真金在专业服务(咨询、定制、集成),毛利率超 65% 且客户粘性极强。开源替代正在颠覆:开源模型(Llama 4、DeepSeek)在 85-90% 场景下已够用,成本仅为闭源的 5-20%。
下一步:从看懂了到会用了
AI 概念不吓人——用对工具做对事才是核心能力。真正的 AI 商业壁垒在于把业务场景理解力和正确的技术组件组合在一起。做产业分析、行业分析、商业模式分析时,把这份报告当速查手册用。
OPC AI 方向 · 知识科普报告 · 2026.05 · 持续更新