UC Berkeley · CS 185/285 · Spring 2026

Deep Reinforcement Learning

深度强化学习、决策与控制课程资料,以及一份可跟踪进度的 7 周自学计划。

学习周期 2026.07.21 — 09.05
固定时段 周二 / 周四 / 周六
单次学习 08:00 — 10:40

Course updates

Announcements

课程资料索引已上线

Lecture、Discussion、Homework 与 Final Project 均已链接到 GitHub 仓库中的对应文件。

7 周学习计划开始

每次学习按“课程视频 → 课件与讨论 → 代码或笔记”三个阶段进行。

Course calendar

Schedule

Progress 0 / 21
时间规划: 周二学习新理论,周四完成推导与讨论题,周六集中实现作业或项目。文件夹链接直接进入 GitHub 对应目录。
HW / Project 时间块: 连续色块表示从启动到 DDL 的实现周期;绿色为 Homework,紫色为 Final Project,块内标注实现、实验和报告阶段。
Week Date Lecture Discussion Assignment / Project Done

Implementation

Assignments

Final projects

Projects

01

Offline-to-Online RL

从离线数据到在线微调

实现基线、改进分布转换,并在 OGBench 上设计自己的方法。

02

RLHF for Instruction Following

开放式指令遵循的 RLHF

实现离线偏好优化、奖励模型和在线 RLHF,并开展开放式研究。

Quick access

Resources