返回 Blog

Mechanistic Interpretability

可解释性学习

从 Transformer 基础、线性探针与模型转向出发,逐步学习 SAE、特征归因、回路分析与算法机制反向工程。

4 个模块 13 讲 讲义 + Notebook + 代码实验
Module 1

Transformer 与机理可解释性入门

01

1.1 · Transformer from Scratch

从零实现 Transformer

Learning Focus

理解 Transformer 的输入输出、注意力、MLP、训练流程与采样过程,建立后续可解释性分析所需的模型结构直觉。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
02

1.2 · Intro to Mech Interp

机理可解释性入门

Learning Focus

学习 TransformerLens、Hook 与激活缓存,识别 induction heads,并使用消融和组合分数反向分析 induction circuit。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
Module 2

内部表征、模型转向与稀疏特征

03

1.3.1 · Linear Probes

线性探针

Learning Focus

用线性分类器检验模型内部表征,理解可解码性、因果性与探针结论之间的边界。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
04

1.3.2 · Function Vectors & Model Steering

功能向量与模型转向

Learning Focus

使用 nnsight 读取与干预隐状态,提取任务编码向量、function vectors 与 steering vectors,观察其对模型行为的影响。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
05

1.3.3 · Interpretability with SAEs

用稀疏自编码器做可解释性

Learning Focus

理解 SAE latent、稀疏性与重构误差,学习解释、训练和评估 SAE,并讨论单义特征与超位现象。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
06

1.3.4 · Activation Oracles

Activation Oracles

Learning Focus

学习用 activation oracle 理解神经元或特征,实现 oracle 组件,并探索 secret extraction 和自定义 oracle 训练。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
Module 3

特征归因与回路反向工程

07

1.4.1 · Indirect Object Identification

间接宾语识别回路

Learning Focus

在 IOI 任务上使用 logit attribution、activation patching、path patching 与消融,逐步恢复模型的因果计算图。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
08

1.4.2 · SAE Circuits

SAE 回路

Learning Focus

使用 latent gradients、transcoders 和 attribution graphs 构造特征级回路,并通过干预验证回路假设。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
Module 4

算法机制与经典可解释性案例

09

1.5.1 · Balanced Bracket Classifier

平衡括号分类器

Learning Focus

从输出向前追踪平衡括号分类器的计算,识别 total elevation 等中间变量与关键回路。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
10

1.5.2 · Grokking & Modular Arithmetic

Grokking 与模算术

Learning Focus

用傅里叶基分析模算术网络,理解 grokking 过程、周期特征与模型内部实现的算法回路。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
11

1.5.3 · OthelloGPT

OthelloGPT

Learning Focus

用线性探针检查棋盘状态表征,寻找模块化回路,并通过因果干预验证模型的世界模型。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
12

1.5.4 · Toy Models of Superposition & SAEs

超位玩具模型与 SAE

Learning Focus

研究非特权基与特权基中的超位、特征几何、deep double descent,并用玩具模型理解 SAE 的学习动力学。

Materials

讲义 练习 Notebook 参考解答

My Note

待上传
13

1.5.X · Monthly Algorithmic Problems

每月算法可解释性问题

Learning Focus

通过独立算法任务练习从行为假设、表征分析到因果验证的完整反向工程流程。

Materials

讲义

My Note

待上传