新时代AI使用相关的学习

核心概念:四层架构总览

参考博客园七牛云行业应用《MCP、Skills、Agent、LLM:四层架构全解,一文理清核心概念》(2026-04-08)

当前 AI 应用层的核心技术栈可以归纳为四层架构:

层级 角色 一句话描述
LLM 推理核心 / 大脑 负责语言理解与逻辑推理
Agent 执行引擎 / 手脚 在 LLM 之上增加感知-决策-行动循环
MCP / Skill 能力封装 / 神经系统 标准化工具接入与可复用技能包
外部工具/数据 实际操作对象 文件系统、数据库、API 等

LLM(大语言模型)

是什么

Large Language Model,大语言模型。本质是一个训练好的神经网络,输入文本,输出文本。它做的事情可以理解为:给定上文,预测下一个 token(词元)

主流模型

  • Claude 系列(Anthropic):Opus / Sonnet / Haiku,擅长长上下文和编程
  • GPT 系列(OpenAI):GPT-4o、GPT-4.1 等
  • DeepSeek 系列:DeepSeek V3,国产开源代表
  • Gemini 系列(Google):多模态能力突出
  • 通义千问 / 文心一言:国内云厂商主力

关键认知

  • LLM 本身只是一个”文字接龙机”,它没有记忆、没有目标、不会主动行动
  • LLM 的能力上限取决于:模型参数规模 + 训练数据质量 + 上下文窗口大小
  • 上下文窗口(Context Window)决定了 LLM “一次能看多少内容”,是当前竞争的核心指标之一

Agent(智能体)

是什么

Agent 是在 LLM 之上增加了自主执行循环的系统。它让模型从”你问一句我答一句”变成”你给我目标,我拆解步骤自己干”。

核心循环

1
2
3
4
5
感知(观察环境/输入)
→ 推理(LLM 分析当前状态)
→ 决策(选择下一步动作)
→ 执行(调用工具 / 生成回复)
→ 观察结果 → 回到感知

主流框架

框架 特点 GitHub Stars(截至2026.04)
LangChain 全栈 Agent 开发框架,生态最完善 132,263
LangGraph LangChain 的图编排引擎,适合复杂工作流 -
Claude Code Anthropic 的代码 Agent CLI 工具 108,080
OpenAI Agents SDK 轻量级 Agent SDK -

关键认知

  • Agent 的核心价值在于自主决策:它不只是回答,而是选择”接下来做什么”
  • Tool Use(工具调用)是 Agent 区别于普通 LLM 的关键能力
  • 实际落地中,Agent 的可靠性是最大挑战——循环中的一步出错可能导致整个任务失败

MCP(Model Context Protocol)

是什么

MCP 是 Anthropic 于 2024 年 9 月发布的开放协议,用于标准化 AI 模型与外部工具/数据源之间的连接。2025 年 12 月已捐献给 Linux 基金会。

可以把它理解为 **AI 世界的 “USB 接口”**——只要遵循 MCP 协议,任何工具都可以被任何 MCP 兼容的 Agent 调用。

架构

1
2
3
4
5
Agent/LLM(Host)
→ MCP Client(协议客户端)
→ MCP Server A(文件系统)
→ MCP Server B(数据库)
→ MCP Server C(API 工具)
  • MCP Server:对外暴露特定能力(如读写文件、查数据库)
  • MCP Client:嵌入在 Agent 中,负责与 Server 通信
  • 协议本身:基于 JSON-RPC,定义标准的能力发现、调用、错误处理机制

生态数据

  • GitHub Stars:82,885(截至 2026.04)
  • 已获 OpenAI、Google、Microsoft、AWS 全阵营支持
  • 社区 MCP Server 数量快速增长

关键认知

  • MCP 解决的是工具集成的标准化问题——以前每个 Agent 框架都要单独写一遍工具适配,MCP 让工具可以”写一次,到处用”
  • MCP 本身不提供任何工具能力,它只是一个协议规范

Skill

是什么

Skill 是比 MCP 更轻量的能力扩展方式。通常以 Markdown 文件形式分发,内容是告诉 LLM “遇到什么情况、该怎么处理”的指令。

可以把它理解为 **给 AI 的 “SOP 手册”**——一个 Skill 就是一份标准作业程序。

Skill vs MCP 对比

维度 Skill MCP
形式 Markdown / 文本指令 协议 + Server 代码
重量 极轻,纯文本 较重,需运行 Server 进程
适用场景 知识/流程/规范类能力 数据/API/工具类能力
分发 复制粘贴即可 需部署和配置
示例 “代码审查流程”、”会议纪要模板” “文件系统访问”、”数据库查询”

生态数据

  • antigravity-awesome-skills 收录社区可安装 Skills:**1,340+**(截至 2026.04)
  • Claude Code 原生支持 Skill 机制

关键认知

  • Skill 的本质是上下文注入:在执行任务前,把相关 Skill 的指令注入到 LLM 的上下文中
  • 因为 Skills 是纯文本,所以完全没有运行时开销,Token 消耗就是唯一的成本
  • 实践中 Skill 和 MCP 是互补的,而非替代关系

RAG(检索增强生成)

是什么

Retrieval-Augmented Generation。在 LLM 回答问题之前,先从外部知识库中检索相关信息,将检索结果拼入 Prompt,再让 LLM 生成回答。

流程

1
用户提问 → 向量检索(从知识库找相关内容)→ 拼接 Prompt → LLM 生成回答

关键认知

  • RAG 解决的是 LLM 的知识截止日期幻觉问题
  • 固定分块策略已过时,语义分块 + 自适应分块是当前主流
  • RAG 可以看作给 LLM 装上了”可查询的外部记忆”

CLI(命令行接口)与 AI

为什么 CLI 在 AI 时代重要

CLI(Command Line Interface)天然适合 AI Agent 操作:

  • 文本输入输出:LLM 最擅长的交互形式
  • 可脚本化:可以被 Agent 自动化调用
  • 无 GUI 依赖:不依赖图形界面,适合服务器/CI 环境

代表性工具:Claude Code

Claude Code 是 Anthropic 推出的命令行 AI 编程助手

  • 直接在终端中使用,可以读写文件、执行命令、操作 Git
  • 通过 Skill 和 MCP 扩展能力
  • 体现了 “Agent + CLI” 的典型范式

总结:一张图理清关系

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
┌──────────────────────────────────────────────┐
│ Skill │ ← 可插拔能力包(SOP 手册)
│ ┌──────────────────────────────────────────┐ │
│ │ Agent │ │ ← 执行循环(感知→推理→行动→观察)
│ │ ┌──────────────────────────────────────┐ │ │
│ │ │ LLM │ │ │ ← 推理引擎(大脑)
│ │ │ │ │ │
│ │ │ Claude / GPT / DeepSeek / ... │ │ │
│ │ └──────────────────────────────────────┘ │ │
│ │ ↕ MCP 协议 │ │ ← 标准化工具总线
│ │ ┌──────────────────────────────────────┐ │ │
│ │ │ 外部工具/数据 │ │ │ ← 文件、数据库、API
│ │ └──────────────────────────────────────┘ │ │
│ └──────────────────────────────────────────┘ │
└──────────────────────────────────────────────┘
↕ RAG:外部知识检索,喂给 LLM

一句话总结LLM 是大脑,RAG 是记忆,Agent 是手脚,MCP 是神经系统,Skill 是习得的技能。


学习资源