理解大模型,用好Vibe Coding。
理解大模型,用好Vibe Coding。

理解大模型,用好Vibe Coding。

一、AI是怎么学会思考的?

1950年,大名鼎鼎的计算机科学之父Alan Turing提出了著名的图灵测试。也就是说,如果⼀个⼈隔着墙和机器⼈聊天,如果不能分辨对⽅是⼈还是机器,这个机器就算是具有智能了。

1、规则驱动阶段(专家系统)

这是人类早期向大模型的探索。

如果 看到⽑茸茸的、有尖⽿朵的、有⻓尾巴的动物,那么 它是猫。

本质是规则的穷举,将人类的知识编写成无数条if else规则。

局限性:世界太过于复杂,⼈⼒资源有限,不可能写⼊所有规则。

2、机器学习阶段(数据寻找规律)

核心逻辑: 不再手写规则,而是给机器数据和答案,让它自己总结规律。

三大路径:

  • 监督学习: 带标签训练(这是猫,那是狗)。
  • 无监督学习: 自动聚类(自动区分新闻类别)。
  • 强化学习: 奖励与惩罚机制(如 AlphaGo)。

3、深度学习阶段(神经网络)

核心逻辑: 模拟人脑神经元,通过隐藏层(Hidden Layers)自动提取和组合特征。

突破: 摆脱了人工提取特征的依赖,能够处理更复杂的视觉和语言任务。

局限: 擅长做“选择题”和“判断题”,缺乏真正的创作能力。

4、Transformer 架构突破

关键转折点: 2017 年 Google 提出 《Attention Is All You Need》。

核心技术:

  • 注意力机制(Attention): 让模型能同时看到全句,根据上下文精准理解词义。
  • 并行计算: 极大提升了训练效率,为算力的“量变引起质变”奠定基础。

针对注意力机制,举个例子:“我今天买了两个 苹果 ,洗⼲净后就吃了。””苹果”这个词,既可以指⽔果,也可以指苹果公司。如果是传统模型,可能只能根据词典做机械匹配,⽆法准确判断具体含义。但在注意⼒机制下,模型会同时关注“苹果”周围的上下⽂词汇,⽐如“两个”“洗⼲净”“吃了”,并对这些与语义强相关的信息赋予更⾼权重,因此能够迅速理解,这⾥的“苹果”指的是⽔果,⽽不是公司。

5、基础模型与涌现阶段

核心逻辑: 海量数据 + 巨大参数 + 强悍算力 = 基础模型(Foundation Model)。

核心能力: 涌现能力: 表现出逻辑推理、代码生成、情感理解等未被显式设计的能力。

  • 从选择到创作: AI 从做“判断题”进化到做“填空题”和“作文题”,能够主动生成高质量内容。

6、总结

AI 的进化本质上是人类干预逐渐减少、机器自主性不断增强的过程。现在的 AI 已经从一个“查表机器”进化成了具备理解力与创造力的“数字大脑”。

二、大模型的底层特性

1、核心思想:预测下一个词

(1)给定前⾯所有的词,通过注意⼒机制预测下⼀个词最可能是什么。

(2)举例说明:

2、上下文窗口

(1)上下文窗口为什么不能无限扩大

上下⽂窗⼝的本质是注意⼒计算的范围枷锁,为什么模型不能⽆限制扩⼤上下⽂窗⼝?核⼼是注意⼒计算的复杂度陷阱。我们先明确⼀个公式:

  • ⾃注意⼒的计算复杂度 = O(n²)
  • 其中 n 是输⼊⽂本的 token 数量,这个公式的意思是:计算量会随着 token 数量的增加呈平⽅级爆炸增⻓。

这就是数学边界的核⼼枷锁:哪怕你想把窗⼝从 8192 扩容到 131072,计算量会从 6700 万暴涨到170 亿,显存需求从 262MB 涨到 65.5GB,普通硬件根本扛不住。

(2)上下文窗口越大,放入内容越多就越好吗?

窗⼝变⼤,不等于模型就能稳定理解和利⽤全部内容。原因在于,⼤模型并不是像数据库⼀样“精确存储并调⽤前⽂”,⽽是在⽣成每个 token 时,动态地从整段上下⽂中分配注意⼒。当内容越来越多时,会出现⼏个典型问题:

  • 注意⼒被稀释:前⾯写⼊的规则虽然还在窗⼝⾥,但在⼤量新内容冲刷下,权重会不断下降。
  • 模型更偏向最近信息:离当前问题更近的内容,通常更容易在注意⼒竞争中占优。
  • 中间区域最容易被忽略
  • 信噪⽐下降:上下⽂越⻓,⽆关信息、重复信息、弱相关信息越多,模型筛选重点和维持推理⼀致性的难度越⼤。

总而言之:信息越多,模型越容易失焦;约束越⻓,模型越容易遗忘;⽽且中间区域的信息最容易在注意⼒竞争中被淹没。

因此在我们和AI对话或者Vibe Coding中,应该及时开启新对话或者压缩上下文。

三、Claude Code

1、底层的运行逻辑

Claude Code 的核⼼不是”回答”,⽽是⼀个反复循环的代理过程:

2、上下文的消耗情况

所以,在我们Vibe Coding时,不要加载没用的MCP,会很大程度占用上下文,并加快了Token的消耗。

3、Plan Mode

在 Claude Code 中,通过 Shift + Tab 即可快速切入 Plan Mode(计划模式)。该模式的核心在于解耦“探索”与“执行”

  • 只读探索,边界先行: 在该阶段,Claude 仅进行只读操作。你可以引导它优先澄清目标、划定边界并推演架构,而不直接修改代码。
  • 后置执行,降低容错: 只有在方案达成共识后,才会进入执行阶段。

核心建议: 无论是开发新功能还是修复复杂 Bug,养成“先计划、后动手”的习惯。这不仅能通过深度讨论规避逻辑偏差,还能显著降低因无效代码修改而产生的 Token 损耗,实现效率与成本的双赢。

4、Subagents

(1)为什么用?

最⼤的价值不是”并⾏”,⽽是隔离,扫代码库、跑测试、做审查这类会产⽣⼤量输出的事,塞进主线程很快就把有效上下⽂挤没了,交给 Subagent 做,主线程只拿⼀个摘要,⼲净很多。

(2)创建方法

官方文档:创建自定义 subagents – Claude Code Docs

Claude Code本身含有内置的agents:

如何自定义agents:

第一种是/agent交互式创建,有引导界面,适合新手。

第二种是在 .claude/agents/ 目录下创建 .md 文件

比如在你的项目里创建 .claude/agents/code-reviewer.md:


name: code-reviewer
description: 代码审查专家。当代码改动完成后自动使用。
tools: Read, Glob, Grep, Bash
model: sonnet


你是一个高级代码审查员。审查代码质量、安全性和最佳实践。
关注:SQL注入、XSS、错误处理、代码重复。

保存后直接就能用了。

(3)如何用?

当然,如果自定义了agent:code-reviewer,那么可以通过以下两种方式启动:

  • 用 code-reviewer 帮我看看最近改动的代码
  • @code-reviewer 看看 auth 模块的改动

5、Skill

直接看帖子,很详细了:

如何写一个好的skill 让你的效率加倍 – 文档共建 – LINUX DO

6、Hooks

(1)介绍和使用

(2)与skill的区别

skill不可控,hooks完全可控,必要需求用hooks。

6、上下文压缩

  • Continue,继续在同⼀个会话⾥发下⼀条消息
  • /rewind(esc esc),跳回之前某条消息,从那⾥重试。出现错误⽐较⼤的⽅向性错误,优先使⽤rewind,与其纠错,不如回退
  • /clear,开始新会话,通常带上你刚提炼出来的简报
  • /compact,总结当前会话并在总结之上继续。指明需要保留的⽅向,提前使⽤,不要等⼯具⾃动压缩
  • Subagents,把下⼀段⼯作委托给有独⽴⼲净上下⽂的代理,只把结果拉回来

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注