新时代AI使用相关的学习
#AI
2026-05-30
核心概念:四层架构总览
参考博客园七牛云行业应用《MCP、Skills、Agent、LLM:四层架构全解,一文理清核心概念》(2026-04-08)
当前 AI 应用层的核心技术栈可以归纳为四层架构:
| 层级 | 角色 | 一句话描述 |
|---|---|---|
| LLM | 推理核心 / 大脑 | 负责语言理解与逻辑推理 |
| Agent | 执行引擎 / 手脚 | 在 LLM 之上增加感知-决策-行动循环 |
| MCP / Skill | 能力封装 / 神经系统 | 标准化工具接入与可复用技能包 |
| 外部工具/数据 | 实际操作对象 | 文件系统、数据库、API 等 |
LLM(大语言模型)
是什么
Large Language Model,大语言模型。本质是一个训练好的神经网络,输入文本,输出文本。它做的事情可以理解为:给定上文,预测下一个 token(词元)。
主流模型
- Claude 系列(Anthropic):Opus / Sonnet / Haiku,擅长长上下文和编程
- GPT 系列(OpenAI):GPT-4o、GPT-4.1 等
- DeepSeek 系列:DeepSeek V3,国产开源代表
- Gemini 系列(Google):多模态能力突出
- 通义千问 / 文心一言:国内云厂商主力
关键认知
- LLM 本身只是一个”文字接龙机”,它没有记忆、没有目标、不会主动行动
- LLM 的能力上限取决于:模型参数规模 + 训练数据质量 + 上下文窗口大小
- 上下文窗口(Context Window)决定了 LLM “一次能看多少内容”,是当前竞争的核心指标之一
Agent(智能体)
是什么
Agent 是在 LLM 之上增加了自主执行循环的系统。它让模型从”你问一句我答一句”变成”你给我目标,我拆解步骤自己干”。
核心循环
1 | 感知(观察环境/输入) |
主流框架
| 框架 | 特点 | GitHub Stars(截至2026.04) |
|---|---|---|
| LangChain | 全栈 Agent 开发框架,生态最完善 | 132,263 |
| LangGraph | LangChain 的图编排引擎,适合复杂工作流 | - |
| Claude Code | Anthropic 的代码 Agent CLI 工具 | 108,080 |
| OpenAI Agents SDK | 轻量级 Agent SDK | - |
关键认知
- Agent 的核心价值在于自主决策:它不只是回答,而是选择”接下来做什么”
- Tool Use(工具调用)是 Agent 区别于普通 LLM 的关键能力
- 实际落地中,Agent 的可靠性是最大挑战——循环中的一步出错可能导致整个任务失败
MCP(Model Context Protocol)
是什么
MCP 是 Anthropic 于 2024 年 9 月发布的开放协议,用于标准化 AI 模型与外部工具/数据源之间的连接。2025 年 12 月已捐献给 Linux 基金会。
可以把它理解为 **AI 世界的 “USB 接口”**——只要遵循 MCP 协议,任何工具都可以被任何 MCP 兼容的 Agent 调用。
架构
1 | Agent/LLM(Host) |
- MCP Server:对外暴露特定能力(如读写文件、查数据库)
- MCP Client:嵌入在 Agent 中,负责与 Server 通信
- 协议本身:基于 JSON-RPC,定义标准的能力发现、调用、错误处理机制
生态数据
- GitHub Stars:82,885(截至 2026.04)
- 已获 OpenAI、Google、Microsoft、AWS 全阵营支持
- 社区 MCP Server 数量快速增长
关键认知
- MCP 解决的是工具集成的标准化问题——以前每个 Agent 框架都要单独写一遍工具适配,MCP 让工具可以”写一次,到处用”
- MCP 本身不提供任何工具能力,它只是一个协议规范
Skill
是什么
Skill 是比 MCP 更轻量的能力扩展方式。通常以 Markdown 文件形式分发,内容是告诉 LLM “遇到什么情况、该怎么处理”的指令。
可以把它理解为 **给 AI 的 “SOP 手册”**——一个 Skill 就是一份标准作业程序。
Skill vs MCP 对比
| 维度 | Skill | MCP |
|---|---|---|
| 形式 | Markdown / 文本指令 | 协议 + Server 代码 |
| 重量 | 极轻,纯文本 | 较重,需运行 Server 进程 |
| 适用场景 | 知识/流程/规范类能力 | 数据/API/工具类能力 |
| 分发 | 复制粘贴即可 | 需部署和配置 |
| 示例 | “代码审查流程”、”会议纪要模板” | “文件系统访问”、”数据库查询” |
生态数据
- antigravity-awesome-skills 收录社区可安装 Skills:**1,340+**(截至 2026.04)
- Claude Code 原生支持 Skill 机制
关键认知
- Skill 的本质是上下文注入:在执行任务前,把相关 Skill 的指令注入到 LLM 的上下文中
- 因为 Skills 是纯文本,所以完全没有运行时开销,Token 消耗就是唯一的成本
- 实践中 Skill 和 MCP 是互补的,而非替代关系
RAG(检索增强生成)
是什么
Retrieval-Augmented Generation。在 LLM 回答问题之前,先从外部知识库中检索相关信息,将检索结果拼入 Prompt,再让 LLM 生成回答。
流程
1 | 用户提问 → 向量检索(从知识库找相关内容)→ 拼接 Prompt → LLM 生成回答 |
关键认知
- RAG 解决的是 LLM 的知识截止日期和幻觉问题
- 固定分块策略已过时,语义分块 + 自适应分块是当前主流
- RAG 可以看作给 LLM 装上了”可查询的外部记忆”
CLI(命令行接口)与 AI
为什么 CLI 在 AI 时代重要
CLI(Command Line Interface)天然适合 AI Agent 操作:
- 文本输入输出:LLM 最擅长的交互形式
- 可脚本化:可以被 Agent 自动化调用
- 无 GUI 依赖:不依赖图形界面,适合服务器/CI 环境
代表性工具:Claude Code
Claude Code 是 Anthropic 推出的命令行 AI 编程助手:
- 直接在终端中使用,可以读写文件、执行命令、操作 Git
- 通过 Skill 和 MCP 扩展能力
- 体现了 “Agent + CLI” 的典型范式
总结:一张图理清关系
1 | ┌──────────────────────────────────────────────┐ |
一句话总结:LLM 是大脑,RAG 是记忆,Agent 是手脚,MCP 是神经系统,Skill 是习得的技能。