Skip to content

AI 核心概念解析

🎯 目标:理解 AI 背后最重要的几个核心概念,不需要数学或编程基础。

1. 什么是大语言模型(LLM)?

大语言模型就是"读了互联网上几乎所有文字"的 AI。它通过分析海量文本,学会了人类语言的规律,从而能理解你的问题生成流畅的回答

类比理解

想象一个人读了一千万本书,虽然他不一定"理解"每本书的含义,但他能根据上下文,流畅地写出类似的内容。这就是大模型的工作原理。

主流大模型对比

模型公司参数量最大优势开源/闭源
GPT-5.5 Pro / o3OpenAI未公开综合能力最强,生态最完善闭源
Claude Sonnet 5 / Opus 4.7Anthropic未公开长文本、推理、代码能力第一闭源
Gemini 3.1 Pro/UltraGoogle DeepMind未公开多模态、100万上下文、性价比部分开源
LLaMA 4Meta未公开开源标杆开源
DeepSeek V4-Pro / R2深度求索1.6T性价比之王,1M上下文,开源开源
Qwen 3.5 / 3.6-Plus阿里巴巴多尺寸中文能力强,开源表现优秀开源
GLM-5.1智谱AI未公开清华系,代码+Agent能力突出部分开源
Mistral LargeMistral AI未公开欧洲最强,开源+闭源并行部分开源
Grok 4xAI未公开实时信息,X平台深度集成闭源

2. 什么是 Prompt(提示词)?

Prompt 就是你给 AI 的指令。同一件事,不同的 Prompt 会得到完全不同的结果。

❌ 差的 Prompt:帮我写个东西

✅ 好的 Prompt:请帮我写一封求职信,应聘产品经理岗位,突出 3 年互联网经验,
   格式为正式商务邮件,字数 300 字以内

Prompt 的构成要素

一个完整的 Prompt 通常包含:
├── 角色(Role)    → 你希望 AI 扮演什么角色?
├── 任务(Task)    → 你希望 AI 做什么?
├── 要求(Format)  → 有什么具体要求?
├── 约束(Rule)    → 有什么限制条件?
└── 示例(Example) → 能给个参考吗?

学会写好 Prompt 是 AI 时代最重要的技能之一,详见 Prompt 提示词工程

3. 什么是 Token?

Token 是 AI 处理文字的最小单位。你可以把它理解为"AI 眼中的字"。

语言1 Token 约等于
英文4 个字符,约 3/4 个单词
中文1-2 个汉字
日文1-2 个假名/汉字

Token 为什么重要?

💰 计费相关:
- AI 对话是按 Token 计费的(输入 + 输出)
- 输入 1000 Token 约 ¥0.01-0.10(不同模型差异大)

📏 长度限制:
- 每个模型有"上下文窗口"限制
- GPT-5.5: 256K Token ≈ 20万字
- Claude 4.x: 200K Token ≈ 15万字
- Kimi: 2M Token ≈ 200万字

⚡ 速度相关:
- Token 越多,处理越慢、费用越高
- 所以 Prompt 要精简有效

4. 什么是多模态(Multimodal)?

多模态指 AI 能同时处理多种类型的信息:

模态输入(AI 能理解的)输出(AI 能生成的)
文本文章、对话、代码文章、邮件、代码
图片照片、图表、截图绘画、设计图
音频语音、音乐语音朗读、音乐
视频短视频片段短视频生成

各模型的模态支持

模型文本图片输入图片生成语音视频
GPT-5.5
Claude 4.x
Gemini 3.1
DeepSeek V4

5. 什么是 AI Agent(智能体)?

传统 AI 只能一问一答。AI Agent 能自主规划、使用工具、完成复杂任务

传统 AI:你问 → 它答 → 结束

AI Agent:
  你给目标:"帮我调研竞品"
  → 第 1 步:自动上网搜索竞品列表
  → 第 2 步:逐个访问官网收集信息
  → 第 3 步:整理数据做成对比表
  → 第 4 步:生成分析报告
  → 输出完整报告

Agent 的核心组成

AI Agent = LLM(大脑)+ 工具(手脚)+ 记忆(经验)+ 规划(策略)

- LLM:负责思考和决策
- 工具:搜索、计算器、代码执行、API 调用等
- 记忆:记住之前的对话和操作
- 规划:把大任务拆解成小步骤

详见 AI Agent 智能体

6. 训练 vs 推理:AI 是怎么"学会"的?

训练(Training)

训练 = 教 AI 学习的过程

类比:学生上课、做题、考试

过程:
1. 收集大量数据(互联网文本、书籍、代码等)
2. 让 AI 学习数据中的规律(预训练)
3. 用人类评价来优化 AI 的回答(微调/RLHF)
4. 经过数月甚至数月的训练,得到可用的模型

训练成本极高:训练 GPT-5 级模型估计花费数十亿美元

推理(Inference)

推理 = AI 回答你的问题的过程

类比:学生考试答题

过程:
1. 你输入 Prompt
2. AI 根据训练学到的知识生成回答
3. 回答一个 Token 一个 Token 地"吐"出来

推理成本低但需要算力:所以需要 GPU 服务器

通俗对比

对比训练推理
类比上学学习考试答题
频率一次(或定期更新)每次对话都在推理
时间数月几秒
成本极高(数十亿)较低(每次几分钱)
谁在做AI 公司(OpenAI等)每个用户

7. Transformer:AI 背后的核心架构

你不需要理解 Transformer 的数学细节,只需要知道它做了什么:

核心思想:注意力机制(Attention)

传统方法:AI 读句子时一个字一个字地看
Transformer:AI 可以同时看到所有字,并关注最重要的部分

举个例子:
"小明把苹果给了小红,她很开心"

AI 通过注意力机制知道:
- "她" 最可能指的是 "小红"
- 即使 "她" 和 "小红" 隔了好几个字

为什么 Transformer 如此重要?

优势说明
并行处理能同时处理所有文字,速度极快
长距离理解能理解相隔很远的文字之间的关系
可扩展性模型越大,能力越强(Scaling Law)
通用性文字、图片、语音都能处理

几乎所有现代 AI(GPT、Claude、Gemini、DeepSeek)都基于 Transformer 架构。


← 上一篇:术语对照 | 下一篇:AI 能做什么 →

AI 小白入门指南 — 让每个人都能用好 AI