Перейти к содержанию

Программа

Двадцать семь модулей в семи частях. Порядок не случаен: части I–II дают инструмент проверки и базовые линии, которые в частях III–VI придётся побеждать, а часть VII превращает всё это в навык работы с чужими результатами.

Оценка времени — для человека, который занимается около десяти часов в неделю. Модуль считается пройденным, когда ноутбук запускается сверху вниз без правок и вы можете ответить на вопросы из «проверки себя», не подглядывая.


Часть I. Как проверяют утверждения

Математика вводится здесь не «на всякий случай», а под конкретную задачу: понять, когда одно число означает результат, а когда — шум.

Модуль О чём Время
1 Что значит «работает» Утверждение, базовая линия, шум. Среднее, дисперсия, доверительный интервал, зёрна ГПСЧ, IQM и бутстрэп. Проверяем опубликованное заявление руками 1 нед.
2 Данные и вероятность Параметр против оценки, закон больших чисел и ЦПТ, формула для числа зёрен, теорема Байеса на редком событии. Переобучение как явление, а не как термин 2 нед.
3 Линейная алгебра как язык Вектор, матрица как преобразование, проекция, собственные числа. Всё через регрессию и PCA, выведенные с нуля, без абстрактных упражнений 2 нед.
4 Производные и оптимизация Градиент, цепное правило, gradient check, длина шага, овраг, момент и SGD. Пишем спуск с нуля и смотрим, где он ломается 2 нед.

Часть II. Классический ML: линии, которые надо побеждать

Эта часть существует потому, что без неё невозможно понять, что означает результат нейросети. Больше половины «прорывов» проигрывают правильно настроенному бустингу.

Модуль О чём Время
5 Линейные модели и метрики Линейная и логистическая регрессия, регуляризация. Почему accuracy почти всегда врёт, и что считать вместо неё 2 нед.
6 Деревья и ансамбли Решающее дерево, случайный лес, градиентный бустинг. Почему на табличных данных он до сих пор выигрывает у нейросетей 2 нед.
7 Честное сравнение Разбиения, кросс-валидация, утечки, подглядывание в тест. Трекинг прогонов, чтобы число можно было предъявить через полгода 1 нед.

Часть III. Нейросети

Модуль О чём Время
8 Полносвязные сети и backprop Прямой и обратный проход с нуля на NumPy, принятые gradient check до обучения. Инициализация, затухание градиента и честное сравнение с бустингом из модуля 6 2 нед.
9 Свёртки и представления Свёрточный слой и пулинг с нуля, эквивариантность против инвариантности, аугментации, перенос обучения. Что сеть выучила и как это посмотреть 2 нед.
10 Последовательности и внимание RNN и почему их вытеснили. Механизм внимания и трансформер — пишем attention с нуля 3 нед.
11 Языковые модели Предобучение, дообучение, инференс, квантизация. Оценка LLM и почему она сложнее, чем кажется 3 нед.

Часть IV. Обучение с подкреплением и психология

Модуль О чём Время
12 Среда, награда, политика Марковский процесс принятия решений, ценность, политика. Закон эффекта Торндайка и оперантное обусловливание как та же модель на сто лет раньше 2 нед.
13 TD-обучение и дофамин Ошибка предсказания награды. Эксперименты Шульца 1997 года, где разряды дофаминовых нейронов совпали с сигналом ошибки в алгоритме — редкий случай, когда алгоритм предсказал нейробиологию 2 нед.
14 Policy gradient и современные методы REINFORCE, актор-критик, PPO, SAC. Почему в RL воспроизводимость особенно плоха и что с этим делают 3 нед.
15 RL там, где есть цена ошибки Запасы, ценообразование, очереди, энергетика. Сравнение с методами исследования операций: когда обучение выигрывает, а когда классика уже оптимальна 2 нед.
16 Награда как спецификация Reward hacking, закон Гудхарта, обучение на обратной связи человека. Что происходит, когда оптимизируют не то, что имели в виду 2 нед.

Часть V. Рекомендательные системы и экономика внимания

Модуль О чём Время
17 Коллаборативная фильтрация Матрица взаимодействий, соседи, матричные разложения, холодный старт 2 нед.
18 Нейронные рекомендатели и ранжирование Two-tower, последовательные модели, метрики ранжирования. Почему офлайн-метрика и онлайн-эффект расходятся 2 нед.
19 Петли обратной связи и внимание Система обучается на данных, которые сама и породила. Пузырь фильтров, оптимизация вовлечения и её психологическая цена 2 нед.
20 A/B-тесты и причинность Корреляция против причины, рандомизация, подглядывание в промежуточные результаты, множественные сравнения 2 нед.

Часть VI. Агенты

Модуль О чём Время
21 Цикл агента Инструменты, состояние, память, планирование. Пишем цикл, который умещается на экране, и смотрим на трейс 2 нед.
22 Поиск и проверяемость RAG, гибридный поиск, реранкер. Проверка цитат: как сделать ответ, который нельзя выдумать 2 нед.
23 Оценка агентов Eval как тест, golden set, регрессия как разница между прогонами 1 нед.

Часть VII. Выход на фронтир

Ради этой части написаны предыдущие шесть.

Модуль О чём Время
24 Как читать статью Структура работы, что читать первым, где искать слабое место. Разбираем три статьи: сильную, слабую и отозванную 1 нед.
25 Как устроена область arXiv, конференции, рецензирование, бенчмарки. Почему лидерборд — плохой источник истины и как им всё-таки пользоваться 1 нед.
26 Воспроизведение От статьи до работающего кода: чего в статье не написали, как спрашивать авторов, что считать успехом 2 нед.
27 Как следить за областью Практика чтения: источники, фильтры, заметки, как не утонуть в потоке и не отстать 1 нед.

Выпускная работа

Взять статью, вышедшую после начала вашего обучения, воспроизвести её центральное утверждение, сравнить с честной базовой линией и опубликовать отчёт: что сошлось, что нет и почему. Отчёт — открытый репозиторий с кодом, который запускается, и числами, которые можно пересчитать.

Это не упражнение. Это ровно та работа, которую делает исследователь в первый месяц на новом месте, и единственное доказательство, что курс сработал.


Итого

Около 50 недель при десяти часах в неделю — год неспешно или полгода плотно. Части I–II (8 недель) имеют смысл сами по себе: даже если вы остановитесь на них, вы будете читать статьи внимательнее, чем большинство тех, кто их пишет.