一、AI是怎么学会思考的?
1950年,大名鼎鼎的计算机科学之父Alan Turing提出了著名的图灵测试。也就是说,如果⼀个⼈隔着墙和机器⼈聊天,如果不能分辨对⽅是⼈还是机器,这个机器就算是具有智能了。
1、规则驱动阶段(专家系统)
这是人类早期向大模型的探索。
如果 看到⽑茸茸的、有尖⽿朵的、有⻓尾巴的动物,那么 它是猫。
本质是规则的穷举,将人类的知识编写成无数条if else规则。
局限性:世界太过于复杂,⼈⼒资源有限,不可能写⼊所有规则。
2、机器学习阶段(数据寻找规律)
核心逻辑: 不再手写规则,而是给机器数据和答案,让它自己总结规律。
三大路径:
- 监督学习: 带标签训练(这是猫,那是狗)。
- 无监督学习: 自动聚类(自动区分新闻类别)。
- 强化学习: 奖励与惩罚机制(如 AlphaGo)。
3、深度学习阶段(神经网络)
核心逻辑: 模拟人脑神经元,通过隐藏层(Hidden Layers)自动提取和组合特征。
突破: 摆脱了人工提取特征的依赖,能够处理更复杂的视觉和语言任务。
局限: 擅长做“选择题”和“判断题”,缺乏真正的创作能力。
4、Transformer 架构突破
关键转折点: 2017 年 Google 提出 《Attention Is All You Need》。
核心技术:
- 注意力机制(Attention): 让模型能同时看到全句,根据上下文精准理解词义。
- 并行计算: 极大提升了训练效率,为算力的“量变引起质变”奠定基础。
针对注意力机制,举个例子:“我今天买了两个 苹果 ,洗⼲净后就吃了。””苹果”这个词,既可以指⽔果,也可以指苹果公司。如果是传统模型,可能只能根据词典做机械匹配,⽆法准确判断具体含义。但在注意⼒机制下,模型会同时关注“苹果”周围的上下⽂词汇,⽐如“两个”“洗⼲净”“吃了”,并对这些与语义强相关的信息赋予更⾼权重,因此能够迅速理解,这⾥的“苹果”指的是⽔果,⽽不是公司。
5、基础模型与涌现阶段
核心逻辑: 海量数据 + 巨大参数 + 强悍算力 = 基础模型(Foundation Model)。
核心能力: 涌现能力: 表现出逻辑推理、代码生成、情感理解等未被显式设计的能力。
- 从选择到创作: AI 从做“判断题”进化到做“填空题”和“作文题”,能够主动生成高质量内容。
6、总结
AI 的进化本质上是人类干预逐渐减少、机器自主性不断增强的过程。现在的 AI 已经从一个“查表机器”进化成了具备理解力与创造力的“数字大脑”。

二、大模型的底层特性
1、核心思想:预测下一个词
(1)给定前⾯所有的词,通过注意⼒机制预测下⼀个词最可能是什么。
(2)举例说明:

2、上下文窗口
(1)上下文窗口为什么不能无限扩大
上下⽂窗⼝的本质是注意⼒计算的范围枷锁,为什么模型不能⽆限制扩⼤上下⽂窗⼝?核⼼是注意⼒计算的复杂度陷阱。我们先明确⼀个公式:
- ⾃注意⼒的计算复杂度 = O(n²)
- 其中 n 是输⼊⽂本的 token 数量,这个公式的意思是:计算量会随着 token 数量的增加呈平⽅级爆炸增⻓。

这就是数学边界的核⼼枷锁:哪怕你想把窗⼝从 8192 扩容到 131072,计算量会从 6700 万暴涨到170 亿,显存需求从 262MB 涨到 65.5GB,普通硬件根本扛不住。
(2)上下文窗口越大,放入内容越多就越好吗?
窗⼝变⼤,不等于模型就能稳定理解和利⽤全部内容。原因在于,⼤模型并不是像数据库⼀样“精确存储并调⽤前⽂”,⽽是在⽣成每个 token 时,动态地从整段上下⽂中分配注意⼒。当内容越来越多时,会出现⼏个典型问题:
- 注意⼒被稀释:前⾯写⼊的规则虽然还在窗⼝⾥,但在⼤量新内容冲刷下,权重会不断下降。
- 模型更偏向最近信息:离当前问题更近的内容,通常更容易在注意⼒竞争中占优。
- 中间区域最容易被忽略
- 信噪⽐下降:上下⽂越⻓,⽆关信息、重复信息、弱相关信息越多,模型筛选重点和维持推理⼀致性的难度越⼤。
总而言之:信息越多,模型越容易失焦;约束越⻓,模型越容易遗忘;⽽且中间区域的信息最容易在注意⼒竞争中被淹没。
因此在我们和AI对话或者Vibe Coding中,应该及时开启新对话或者压缩上下文。
三、Claude Code
1、底层的运行逻辑

Claude Code 的核⼼不是”回答”,⽽是⼀个反复循环的代理过程:

2、上下文的消耗情况

所以,在我们Vibe Coding时,不要加载没用的MCP,会很大程度占用上下文,并加快了Token的消耗。
3、Plan Mode

在 Claude Code 中,通过 Shift + Tab 即可快速切入 Plan Mode(计划模式)。该模式的核心在于解耦“探索”与“执行”:
- 只读探索,边界先行: 在该阶段,Claude 仅进行只读操作。你可以引导它优先澄清目标、划定边界并推演架构,而不直接修改代码。
- 后置执行,降低容错: 只有在方案达成共识后,才会进入执行阶段。
核心建议: 无论是开发新功能还是修复复杂 Bug,养成“先计划、后动手”的习惯。这不仅能通过深度讨论规避逻辑偏差,还能显著降低因无效代码修改而产生的 Token 损耗,实现效率与成本的双赢。
4、Subagents
(1)为什么用?
最⼤的价值不是”并⾏”,⽽是隔离,扫代码库、跑测试、做审查这类会产⽣⼤量输出的事,塞进主线程很快就把有效上下⽂挤没了,交给 Subagent 做,主线程只拿⼀个摘要,⼲净很多。
(2)创建方法
官方文档:创建自定义 subagents – Claude Code Docs
Claude Code本身含有内置的agents:

如何自定义agents:
第一种是/agent交互式创建,有引导界面,适合新手。

第二种是在 .claude/agents/ 目录下创建 .md 文件
比如在你的项目里创建 .claude/agents/code-reviewer.md:
name: code-reviewer
description: 代码审查专家。当代码改动完成后自动使用。
tools: Read, Glob, Grep, Bash
model: sonnet
你是一个高级代码审查员。审查代码质量、安全性和最佳实践。
关注:SQL注入、XSS、错误处理、代码重复。
保存后直接就能用了。
(3)如何用?

当然,如果自定义了agent:code-reviewer,那么可以通过以下两种方式启动:
- 用 code-reviewer 帮我看看最近改动的代码
- @code-reviewer 看看 auth 模块的改动
5、Skill
直接看帖子,很详细了:
如何写一个好的skill 让你的效率加倍 – 文档共建 – LINUX DO
6、Hooks
(1)介绍和使用

(2)与skill的区别

skill不可控,hooks完全可控,必要需求用hooks。
6、上下文压缩
- Continue,继续在同⼀个会话⾥发下⼀条消息
- /rewind(esc esc),跳回之前某条消息,从那⾥重试。出现错误⽐较⼤的⽅向性错误,优先使⽤rewind,与其纠错,不如回退
- /clear,开始新会话,通常带上你刚提炼出来的简报
- /compact,总结当前会话并在总结之上继续。指明需要保留的⽅向,提前使⽤,不要等⼯具⾃动压缩
- Subagents,把下⼀段⼯作委托给有独⽴⼲净上下⽂的代理,只把结果拉回来