Программа¶
Двадцать семь модулей в семи частях. Порядок не случаен: части I–II дают инструмент проверки и базовые линии, которые в частях III–VI придётся побеждать, а часть VII превращает всё это в навык работы с чужими результатами.
Оценка времени — для человека, который занимается около десяти часов в неделю. Модуль считается пройденным, когда ноутбук запускается сверху вниз без правок и вы можете ответить на вопросы из «проверки себя», не подглядывая.
Часть I. Как проверяют утверждения¶
Математика вводится здесь не «на всякий случай», а под конкретную задачу: понять, когда одно число означает результат, а когда — шум.
| Модуль | О чём | Время | |
|---|---|---|---|
| 1 | Что значит «работает» | Утверждение, базовая линия, шум. Среднее, дисперсия, доверительный интервал, зёрна ГПСЧ, IQM и бутстрэп. Проверяем опубликованное заявление руками | 1 нед. |
| 2 | Данные и вероятность | Параметр против оценки, закон больших чисел и ЦПТ, формула для числа зёрен, теорема Байеса на редком событии. Переобучение как явление, а не как термин | 2 нед. |
| 3 | Линейная алгебра как язык | Вектор, матрица как преобразование, проекция, собственные числа. Всё через регрессию и PCA, выведенные с нуля, без абстрактных упражнений | 2 нед. |
| 4 | Производные и оптимизация | Градиент, цепное правило, gradient check, длина шага, овраг, момент и SGD. Пишем спуск с нуля и смотрим, где он ломается | 2 нед. |
Часть II. Классический ML: линии, которые надо побеждать¶
Эта часть существует потому, что без неё невозможно понять, что означает результат нейросети. Больше половины «прорывов» проигрывают правильно настроенному бустингу.
| Модуль | О чём | Время | |
|---|---|---|---|
| 5 | Линейные модели и метрики | Линейная и логистическая регрессия, регуляризация. Почему accuracy почти всегда врёт, и что считать вместо неё | 2 нед. |
| 6 | Деревья и ансамбли | Решающее дерево, случайный лес, градиентный бустинг. Почему на табличных данных он до сих пор выигрывает у нейросетей | 2 нед. |
| 7 | Честное сравнение | Разбиения, кросс-валидация, утечки, подглядывание в тест. Трекинг прогонов, чтобы число можно было предъявить через полгода | 1 нед. |
Часть III. Нейросети¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 8 | Полносвязные сети и backprop | Прямой и обратный проход с нуля на NumPy, принятые gradient check до обучения. Инициализация, затухание градиента и честное сравнение с бустингом из модуля 6 | 2 нед. |
| 9 | Свёртки и представления | Свёрточный слой и пулинг с нуля, эквивариантность против инвариантности, аугментации, перенос обучения. Что сеть выучила и как это посмотреть | 2 нед. |
| 10 | Последовательности и внимание | RNN и почему их вытеснили. Механизм внимания и трансформер — пишем attention с нуля, деление на корень из размерности проверяем руками | 3 нед. |
| 11 | Языковые модели | Предобучение как предсказание следующего токена, дообучение, температура, квантизация. Оценка LLM и почему загрязнение бенчмарка — это утечка из модуля 7 | 3 нед. |
Часть IV. Обучение с подкреплением и психология¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 12 | Среда, награда, политика | Марковский процесс принятия решений, отдача и дисконт, уравнение Беллмана и value iteration. Закон эффекта Торндайка и оперантное обусловливание как та же модель на сто лет раньше | 2 нед. |
| 13 | TD-обучение и дофамин | Ошибка предсказания награды, бутстрэп, TD против Монте-Карло. Эксперименты Шульца 1997 года, где разряды дофаминовых нейронов совпали с сигналом ошибки в алгоритме — редкий случай, когда алгоритм предсказал нейробиологию | 2 нед. |
| 14 | Policy gradient и современные методы | REINFORCE, база и преимущество, актор-критик, PPO, SAC. Почему в RL воспроизводимость особенно плоха и как её проверяют бутстрэпом из модуля 1 | 3 нед. |
| 15 | RL там, где есть цена ошибки | Управление запасами, база newsvendor, нестационарность. Честное сравнение с настроенной классикой исследования операций: когда обучение выигрывает, а когда классика уже оптимальна | 2 нед. |
| 16 | Награда как спецификация | Закон Гудхарта, reward hacking, RLHF и штраф KL. Что происходит, когда оптимизируют не то, что имели в виду — одна ошибка, что и в ленте, и на лидерборде | 2 нед. |
Часть V. Рекомендательные системы и экономика внимания¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 17 | Коллаборативная фильтрация | Матрица взаимодействий, соседи, матричное разложение, холодный старт. Смещение к популярному и база «топ популярного» из модуля 1 | 2 нед. |
| 18 | Нейронные рекомендатели и ранжирование | Two-tower, последовательные модели, метрики ранжирования (NDCG). Почему офлайн-метрика на логах оптимистична и слепа, а честна только проверка A/B | 2 нед. |
| 19 | Петли обратной связи и внимание | Система обучается на данных, которые сама и породила. Пузырь фильтров, эффект Матфея, вовлечение как прокси и его психологическая цена. Два смысла «внимания» | 2 нед. |
| 20 | A/B-тесты и причинность | Конфаундер и рандомизация, подглядывание в промежуточные результаты, множественные сравнения. Тот же арсенал модуля 1, но на живых пользователях | 2 нед. |
Часть VI. Агенты¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 21 | Цикл агента | Инструменты, состояние, память, планирование. Пишем цикл, который умещается на экране, читаемый трейс, и как из него растёт eval | 2 нед. |
| 22 | Поиск и проверяемость | RAG, гибридный поиск, реранкер. Проверка цитат: как сделать ответ, который нельзя выдумать | 2 нед. |
| 23 | Оценка агентов | Eval как тест, golden set, регрессия как разница между прогонами | 1 нед. |
Часть VII. Выход на фронтир¶
Ради этой части написаны предыдущие шесть.
| Модуль | О чём | Время | |
|---|---|---|---|
| 24 | Как читать статью | Структура работы, что читать первым, где искать слабое место. Разбираем три статьи: сильную, слабую и отозванную | 1 нед. |
| 25 | Как устроена область | arXiv, конференции, рецензирование, бенчмарки. Почему лидерборд — плохой источник истины и как им всё-таки пользоваться | 1 нед. |
| 26 | Воспроизведение | От статьи до работающего кода: чего в статье не написали, как спрашивать авторов, что считать успехом | 2 нед. |
| 27 | Как следить за областью | Практика чтения: источники, фильтры, заметки, как не утонуть в потоке и не отстать | 1 нед. |
Выпускная работа¶
Взять статью, вышедшую после начала вашего обучения, воспроизвести её центральное утверждение, сравнить с честной базовой линией и опубликовать отчёт: что сошлось, что нет и почему. Отчёт — открытый репозиторий с кодом, который запускается, и числами, которые можно пересчитать.
Это не упражнение. Это ровно та работа, которую делает исследователь в первый месяц на новом месте, и единственное доказательство, что курс сработал.
Как её выбрать, сделать и оформить — подробный разбор с чек-листом на странице «Выпускная работа».
Итого¶
Около 50 недель при десяти часах в неделю — год неспешно или полгода плотно. Части I–II (12 недель) имеют смысл сами по себе: даже если вы остановитесь на них, вы будете читать статьи внимательнее, чем большинство тех, кто их пишет.