Программа¶
Двадцать семь модулей в семи частях. Порядок не случаен: части I–II дают инструмент проверки и базовые линии, которые в частях III–VI придётся побеждать, а часть VII превращает всё это в навык работы с чужими результатами.
Оценка времени — для человека, который занимается около десяти часов в неделю. Модуль считается пройденным, когда ноутбук запускается сверху вниз без правок и вы можете ответить на вопросы из «проверки себя», не подглядывая.
Часть I. Как проверяют утверждения¶
Математика вводится здесь не «на всякий случай», а под конкретную задачу: понять, когда одно число означает результат, а когда — шум.
| Модуль | О чём | Время | |
|---|---|---|---|
| 1 | Что значит «работает» | Утверждение, базовая линия, шум. Среднее, дисперсия, доверительный интервал, зёрна ГПСЧ, IQM и бутстрэп. Проверяем опубликованное заявление руками | 1 нед. |
| 2 | Данные и вероятность | Параметр против оценки, закон больших чисел и ЦПТ, формула для числа зёрен, теорема Байеса на редком событии. Переобучение как явление, а не как термин | 2 нед. |
| 3 | Линейная алгебра как язык | Вектор, матрица как преобразование, проекция, собственные числа. Всё через регрессию и PCA, выведенные с нуля, без абстрактных упражнений | 2 нед. |
| 4 | Производные и оптимизация | Градиент, цепное правило, gradient check, длина шага, овраг, момент и SGD. Пишем спуск с нуля и смотрим, где он ломается | 2 нед. |
Часть II. Классический ML: линии, которые надо побеждать¶
Эта часть существует потому, что без неё невозможно понять, что означает результат нейросети. Больше половины «прорывов» проигрывают правильно настроенному бустингу.
| Модуль | О чём | Время | |
|---|---|---|---|
| 5 | Линейные модели и метрики | Линейная и логистическая регрессия, регуляризация. Почему accuracy почти всегда врёт, и что считать вместо неё | 2 нед. |
| 6 | Деревья и ансамбли | Решающее дерево, случайный лес, градиентный бустинг. Почему на табличных данных он до сих пор выигрывает у нейросетей | 2 нед. |
| 7 | Честное сравнение | Разбиения, кросс-валидация, утечки, подглядывание в тест. Трекинг прогонов, чтобы число можно было предъявить через полгода | 1 нед. |
Часть III. Нейросети¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 8 | Полносвязные сети и backprop | Прямой и обратный проход с нуля на NumPy, принятые gradient check до обучения. Инициализация, затухание градиента и честное сравнение с бустингом из модуля 6 | 2 нед. |
| 9 | Свёртки и представления | Свёрточный слой и пулинг с нуля, эквивариантность против инвариантности, аугментации, перенос обучения. Что сеть выучила и как это посмотреть | 2 нед. |
| 10 | Последовательности и внимание | RNN и почему их вытеснили. Механизм внимания и трансформер — пишем attention с нуля | 3 нед. |
| 11 | Языковые модели | Предобучение, дообучение, инференс, квантизация. Оценка LLM и почему она сложнее, чем кажется | 3 нед. |
Часть IV. Обучение с подкреплением и психология¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 12 | Среда, награда, политика | Марковский процесс принятия решений, ценность, политика. Закон эффекта Торндайка и оперантное обусловливание как та же модель на сто лет раньше | 2 нед. |
| 13 | TD-обучение и дофамин | Ошибка предсказания награды. Эксперименты Шульца 1997 года, где разряды дофаминовых нейронов совпали с сигналом ошибки в алгоритме — редкий случай, когда алгоритм предсказал нейробиологию | 2 нед. |
| 14 | Policy gradient и современные методы | REINFORCE, актор-критик, PPO, SAC. Почему в RL воспроизводимость особенно плоха и что с этим делают | 3 нед. |
| 15 | RL там, где есть цена ошибки | Запасы, ценообразование, очереди, энергетика. Сравнение с методами исследования операций: когда обучение выигрывает, а когда классика уже оптимальна | 2 нед. |
| 16 | Награда как спецификация | Reward hacking, закон Гудхарта, обучение на обратной связи человека. Что происходит, когда оптимизируют не то, что имели в виду | 2 нед. |
Часть V. Рекомендательные системы и экономика внимания¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 17 | Коллаборативная фильтрация | Матрица взаимодействий, соседи, матричные разложения, холодный старт | 2 нед. |
| 18 | Нейронные рекомендатели и ранжирование | Two-tower, последовательные модели, метрики ранжирования. Почему офлайн-метрика и онлайн-эффект расходятся | 2 нед. |
| 19 | Петли обратной связи и внимание | Система обучается на данных, которые сама и породила. Пузырь фильтров, оптимизация вовлечения и её психологическая цена | 2 нед. |
| 20 | A/B-тесты и причинность | Корреляция против причины, рандомизация, подглядывание в промежуточные результаты, множественные сравнения | 2 нед. |
Часть VI. Агенты¶
| Модуль | О чём | Время | |
|---|---|---|---|
| 21 | Цикл агента | Инструменты, состояние, память, планирование. Пишем цикл, который умещается на экране, и смотрим на трейс | 2 нед. |
| 22 | Поиск и проверяемость | RAG, гибридный поиск, реранкер. Проверка цитат: как сделать ответ, который нельзя выдумать | 2 нед. |
| 23 | Оценка агентов | Eval как тест, golden set, регрессия как разница между прогонами | 1 нед. |
Часть VII. Выход на фронтир¶
Ради этой части написаны предыдущие шесть.
| Модуль | О чём | Время | |
|---|---|---|---|
| 24 | Как читать статью | Структура работы, что читать первым, где искать слабое место. Разбираем три статьи: сильную, слабую и отозванную | 1 нед. |
| 25 | Как устроена область | arXiv, конференции, рецензирование, бенчмарки. Почему лидерборд — плохой источник истины и как им всё-таки пользоваться | 1 нед. |
| 26 | Воспроизведение | От статьи до работающего кода: чего в статье не написали, как спрашивать авторов, что считать успехом | 2 нед. |
| 27 | Как следить за областью | Практика чтения: источники, фильтры, заметки, как не утонуть в потоке и не отстать | 1 нед. |
Выпускная работа¶
Взять статью, вышедшую после начала вашего обучения, воспроизвести её центральное утверждение, сравнить с честной базовой линией и опубликовать отчёт: что сошлось, что нет и почему. Отчёт — открытый репозиторий с кодом, который запускается, и числами, которые можно пересчитать.
Это не упражнение. Это ровно та работа, которую делает исследователь в первый месяц на новом месте, и единственное доказательство, что курс сработал.
Итого¶
Около 50 недель при десяти часах в неделю — год неспешно или полгода плотно. Части I–II (8 недель) имеют смысл сами по себе: даже если вы остановитесь на них, вы будете читать статьи внимательнее, чем большинство тех, кто их пишет.