AI 核心概念解析
🎯 目标:理解 AI 背后最重要的几个核心概念,不需要数学或编程基础。
1. 什么是大语言模型(LLM)?
大语言模型就是"读了互联网上几乎所有文字"的 AI。它通过分析海量文本,学会了人类语言的规律,从而能理解你的问题并生成流畅的回答。
类比理解:
想象一个人读了一千万本书,虽然他不一定"理解"每本书的含义,但他能根据上下文,流畅地写出类似的内容。这就是大模型的工作原理。
主流大模型对比
| 模型 | 公司 | 参数量 | 最大优势 | 开源/闭源 |
|---|---|---|---|---|
| GPT-5.5 Pro / o3 | OpenAI | 未公开 | 综合能力最强,生态最完善 | 闭源 |
| Claude Sonnet 5 / Opus 4.7 | Anthropic | 未公开 | 长文本、推理、代码能力第一 | 闭源 |
| Gemini 3.1 Pro/Ultra | Google DeepMind | 未公开 | 多模态、100万上下文、性价比 | 部分开源 |
| LLaMA 4 | Meta | 未公开 | 开源标杆 | 开源 |
| DeepSeek V4-Pro / R2 | 深度求索 | 1.6T | 性价比之王,1M上下文,开源 | 开源 |
| Qwen 3.5 / 3.6-Plus | 阿里巴巴 | 多尺寸 | 中文能力强,开源表现优秀 | 开源 |
| GLM-5.1 | 智谱AI | 未公开 | 清华系,代码+Agent能力突出 | 部分开源 |
| Mistral Large | Mistral AI | 未公开 | 欧洲最强,开源+闭源并行 | 部分开源 |
| Grok 4 | xAI | 未公开 | 实时信息,X平台深度集成 | 闭源 |
2. 什么是 Prompt(提示词)?
Prompt 就是你给 AI 的指令。同一件事,不同的 Prompt 会得到完全不同的结果。
❌ 差的 Prompt:帮我写个东西
✅ 好的 Prompt:请帮我写一封求职信,应聘产品经理岗位,突出 3 年互联网经验,
格式为正式商务邮件,字数 300 字以内Prompt 的构成要素
一个完整的 Prompt 通常包含:
├── 角色(Role) → 你希望 AI 扮演什么角色?
├── 任务(Task) → 你希望 AI 做什么?
├── 要求(Format) → 有什么具体要求?
├── 约束(Rule) → 有什么限制条件?
└── 示例(Example) → 能给个参考吗?学会写好 Prompt 是 AI 时代最重要的技能之一,详见 Prompt 提示词工程。
3. 什么是 Token?
Token 是 AI 处理文字的最小单位。你可以把它理解为"AI 眼中的字"。
| 语言 | 1 Token 约等于 |
|---|---|
| 英文 | 4 个字符,约 3/4 个单词 |
| 中文 | 1-2 个汉字 |
| 日文 | 1-2 个假名/汉字 |
Token 为什么重要?
💰 计费相关:
- AI 对话是按 Token 计费的(输入 + 输出)
- 输入 1000 Token 约 ¥0.01-0.10(不同模型差异大)
📏 长度限制:
- 每个模型有"上下文窗口"限制
- GPT-5.5: 256K Token ≈ 20万字
- Claude 4.x: 200K Token ≈ 15万字
- Kimi: 2M Token ≈ 200万字
⚡ 速度相关:
- Token 越多,处理越慢、费用越高
- 所以 Prompt 要精简有效4. 什么是多模态(Multimodal)?
多模态指 AI 能同时处理多种类型的信息:
| 模态 | 输入(AI 能理解的) | 输出(AI 能生成的) |
|---|---|---|
| 文本 | 文章、对话、代码 | 文章、邮件、代码 |
| 图片 | 照片、图表、截图 | 绘画、设计图 |
| 音频 | 语音、音乐 | 语音朗读、音乐 |
| 视频 | 短视频片段 | 短视频生成 |
各模型的模态支持
| 模型 | 文本 | 图片输入 | 图片生成 | 语音 | 视频 |
|---|---|---|---|---|---|
| GPT-5.5 | ✅ | ✅ | ✅ | ✅ | ❌ |
| Claude 4.x | ✅ | ✅ | ❌ | ❌ | ❌ |
| Gemini 3.1 | ✅ | ✅ | ✅ | ✅ | ✅ |
| DeepSeek V4 | ✅ | ✅ | ❌ | ❌ | ❌ |
5. 什么是 AI Agent(智能体)?
传统 AI 只能一问一答。AI Agent 能自主规划、使用工具、完成复杂任务。
传统 AI:你问 → 它答 → 结束
AI Agent:
你给目标:"帮我调研竞品"
→ 第 1 步:自动上网搜索竞品列表
→ 第 2 步:逐个访问官网收集信息
→ 第 3 步:整理数据做成对比表
→ 第 4 步:生成分析报告
→ 输出完整报告Agent 的核心组成
AI Agent = LLM(大脑)+ 工具(手脚)+ 记忆(经验)+ 规划(策略)
- LLM:负责思考和决策
- 工具:搜索、计算器、代码执行、API 调用等
- 记忆:记住之前的对话和操作
- 规划:把大任务拆解成小步骤详见 AI Agent 智能体
6. 训练 vs 推理:AI 是怎么"学会"的?
训练(Training)
训练 = 教 AI 学习的过程
类比:学生上课、做题、考试
过程:
1. 收集大量数据(互联网文本、书籍、代码等)
2. 让 AI 学习数据中的规律(预训练)
3. 用人类评价来优化 AI 的回答(微调/RLHF)
4. 经过数月甚至数月的训练,得到可用的模型
训练成本极高:训练 GPT-5 级模型估计花费数十亿美元推理(Inference)
推理 = AI 回答你的问题的过程
类比:学生考试答题
过程:
1. 你输入 Prompt
2. AI 根据训练学到的知识生成回答
3. 回答一个 Token 一个 Token 地"吐"出来
推理成本低但需要算力:所以需要 GPU 服务器通俗对比
| 对比 | 训练 | 推理 |
|---|---|---|
| 类比 | 上学学习 | 考试答题 |
| 频率 | 一次(或定期更新) | 每次对话都在推理 |
| 时间 | 数月 | 几秒 |
| 成本 | 极高(数十亿) | 较低(每次几分钱) |
| 谁在做 | AI 公司(OpenAI等) | 每个用户 |
7. Transformer:AI 背后的核心架构
你不需要理解 Transformer 的数学细节,只需要知道它做了什么:
核心思想:注意力机制(Attention)
传统方法:AI 读句子时一个字一个字地看
Transformer:AI 可以同时看到所有字,并关注最重要的部分
举个例子:
"小明把苹果给了小红,她很开心"
AI 通过注意力机制知道:
- "她" 最可能指的是 "小红"
- 即使 "她" 和 "小红" 隔了好几个字为什么 Transformer 如此重要?
| 优势 | 说明 |
|---|---|
| 并行处理 | 能同时处理所有文字,速度极快 |
| 长距离理解 | 能理解相隔很远的文字之间的关系 |
| 可扩展性 | 模型越大,能力越强(Scaling Law) |
| 通用性 | 文字、图片、语音都能处理 |
几乎所有现代 AI(GPT、Claude、Gemini、DeepSeek)都基于 Transformer 架构。