Перейти к содержанию

Программа

Двадцать семь модулей в семи частях. Порядок не случаен: части I–II дают инструмент проверки и базовые линии, которые в частях III–VI придётся побеждать, а часть VII превращает всё это в навык работы с чужими результатами.

Оценка времени — для человека, который занимается около десяти часов в неделю. Модуль считается пройденным, когда ноутбук запускается сверху вниз без правок и вы можете ответить на вопросы из «проверки себя», не подглядывая.


Часть I. Как проверяют утверждения

Математика вводится здесь не «на всякий случай», а под конкретную задачу: понять, когда одно число означает результат, а когда — шум.

Модуль О чём Время
1 Что значит «работает» Утверждение, базовая линия, шум. Среднее, дисперсия, доверительный интервал, зёрна ГПСЧ, IQM и бутстрэп. Проверяем опубликованное заявление руками 1 нед.
2 Данные и вероятность Параметр против оценки, закон больших чисел и ЦПТ, формула для числа зёрен, теорема Байеса на редком событии. Переобучение как явление, а не как термин 2 нед.
3 Линейная алгебра как язык Вектор, матрица как преобразование, проекция, собственные числа. Всё через регрессию и PCA, выведенные с нуля, без абстрактных упражнений 2 нед.
4 Производные и оптимизация Градиент, цепное правило, gradient check, длина шага, овраг, момент и SGD. Пишем спуск с нуля и смотрим, где он ломается 2 нед.

Часть II. Классический ML: линии, которые надо побеждать

Эта часть существует потому, что без неё невозможно понять, что означает результат нейросети. Больше половины «прорывов» проигрывают правильно настроенному бустингу.

Модуль О чём Время
5 Линейные модели и метрики Линейная и логистическая регрессия, регуляризация. Почему accuracy почти всегда врёт, и что считать вместо неё 2 нед.
6 Деревья и ансамбли Решающее дерево, случайный лес, градиентный бустинг. Почему на табличных данных он до сих пор выигрывает у нейросетей 2 нед.
7 Честное сравнение Разбиения, кросс-валидация, утечки, подглядывание в тест. Трекинг прогонов, чтобы число можно было предъявить через полгода 1 нед.

Часть III. Нейросети

Модуль О чём Время
8 Полносвязные сети и backprop Прямой и обратный проход с нуля на NumPy, принятые gradient check до обучения. Инициализация, затухание градиента и честное сравнение с бустингом из модуля 6 2 нед.
9 Свёртки и представления Свёрточный слой и пулинг с нуля, эквивариантность против инвариантности, аугментации, перенос обучения. Что сеть выучила и как это посмотреть 2 нед.
10 Последовательности и внимание RNN и почему их вытеснили. Механизм внимания и трансформер — пишем attention с нуля, деление на корень из размерности проверяем руками 3 нед.
11 Языковые модели Предобучение как предсказание следующего токена, дообучение, температура, квантизация. Оценка LLM и почему загрязнение бенчмарка — это утечка из модуля 7 3 нед.

Часть IV. Обучение с подкреплением и психология

Модуль О чём Время
12 Среда, награда, политика Марковский процесс принятия решений, отдача и дисконт, уравнение Беллмана и value iteration. Закон эффекта Торндайка и оперантное обусловливание как та же модель на сто лет раньше 2 нед.
13 TD-обучение и дофамин Ошибка предсказания награды, бутстрэп, TD против Монте-Карло. Эксперименты Шульца 1997 года, где разряды дофаминовых нейронов совпали с сигналом ошибки в алгоритме — редкий случай, когда алгоритм предсказал нейробиологию 2 нед.
14 Policy gradient и современные методы REINFORCE, база и преимущество, актор-критик, PPO, SAC. Почему в RL воспроизводимость особенно плоха и как её проверяют бутстрэпом из модуля 1 3 нед.
15 RL там, где есть цена ошибки Управление запасами, база newsvendor, нестационарность. Честное сравнение с настроенной классикой исследования операций: когда обучение выигрывает, а когда классика уже оптимальна 2 нед.
16 Награда как спецификация Закон Гудхарта, reward hacking, RLHF и штраф KL. Что происходит, когда оптимизируют не то, что имели в виду — одна ошибка, что и в ленте, и на лидерборде 2 нед.

Часть V. Рекомендательные системы и экономика внимания

Модуль О чём Время
17 Коллаборативная фильтрация Матрица взаимодействий, соседи, матричное разложение, холодный старт. Смещение к популярному и база «топ популярного» из модуля 1 2 нед.
18 Нейронные рекомендатели и ранжирование Two-tower, последовательные модели, метрики ранжирования (NDCG). Почему офлайн-метрика на логах оптимистична и слепа, а честна только проверка A/B 2 нед.
19 Петли обратной связи и внимание Система обучается на данных, которые сама и породила. Пузырь фильтров, эффект Матфея, вовлечение как прокси и его психологическая цена. Два смысла «внимания» 2 нед.
20 A/B-тесты и причинность Конфаундер и рандомизация, подглядывание в промежуточные результаты, множественные сравнения. Тот же арсенал модуля 1, но на живых пользователях 2 нед.

Часть VI. Агенты

Модуль О чём Время
21 Цикл агента Инструменты, состояние, память, планирование. Пишем цикл, который умещается на экране, читаемый трейс, и как из него растёт eval 2 нед.
22 Поиск и проверяемость RAG, гибридный поиск, реранкер. Проверка цитат: как сделать ответ, который нельзя выдумать 2 нед.
23 Оценка агентов Eval как тест, golden set, регрессия как разница между прогонами 1 нед.

Часть VII. Выход на фронтир

Ради этой части написаны предыдущие шесть.

Модуль О чём Время
24 Как читать статью Структура работы, что читать первым, где искать слабое место. Разбираем три статьи: сильную, слабую и отозванную 1 нед.
25 Как устроена область arXiv, конференции, рецензирование, бенчмарки. Почему лидерборд — плохой источник истины и как им всё-таки пользоваться 1 нед.
26 Воспроизведение От статьи до работающего кода: чего в статье не написали, как спрашивать авторов, что считать успехом 2 нед.
27 Как следить за областью Практика чтения: источники, фильтры, заметки, как не утонуть в потоке и не отстать 1 нед.

Выпускная работа

Взять статью, вышедшую после начала вашего обучения, воспроизвести её центральное утверждение, сравнить с честной базовой линией и опубликовать отчёт: что сошлось, что нет и почему. Отчёт — открытый репозиторий с кодом, который запускается, и числами, которые можно пересчитать.

Это не упражнение. Это ровно та работа, которую делает исследователь в первый месяц на новом месте, и единственное доказательство, что курс сработал.

Как её выбрать, сделать и оформить — подробный разбор с чек-листом на странице «Выпускная работа».


Итого

Около 50 недель при десяти часах в неделю — год неспешно или полгода плотно. Части I–II (12 недель) имеют смысл сами по себе: даже если вы остановитесь на них, вы будете читать статьи внимательнее, чем большинство тех, кто их пишет.