Замеры
Цифры с условиями, при которых они получены
Здесь нет логотипов клиентов и нет кейсов. Открытая организация может показать вместо них
свои замеры и команды, которыми они воспроизводятся.
Запас между настроенным классическим методом и посчитанным оптимумом в stadion, с 95%
бутстрап-интервалом на парной разности. Замер на 40 инстансах × 20 эпизодов;
воспроизводится командой stadion run <task> --agent classical --instances 40 --episodes 20.
| Задача | Запас | 95% интервал |
inventory | +0.4% | [+0.561, +1.031] |
joint-pricing | +4.3% | [+3.794, +5.656] |
pricing | +6.2% | [+1.265, +1.761] |
queueing | +16.9% | [+3.418, +3.988] |
supply-chain | +17.3% | [+5.505, +7.493] |
energy | +26.6% | [+4.221, +4.690] |
Разброс здесь и есть содержание. Там, где учебный ответ уже почти оптимален, выигрывать
нечего; там, где он не умеет планировать вперёд, на столе остаётся четверть ценности.
Бенчмарк, у которого все задачи оставляют щедрый запас, отобран под проблемы, на которых
стандартный метод плох.
- Алгоритмов
- 32В decisionrl, на 24 средах — девять из них прикладные, а не синтетические.
- Обязательных зависимостей
- 0Ядро glia не импортирует ничего вне стандартной библиотеки. Провайдеры и расширения подключаются явно.
- Покрытие строк
- 84%decisionrl, замер pytest-cov по быстрому набору в CI. Ниже 80% сборка падает, а не сообщает цифру.
- Поиск, recall@5
- 0.92praxis, на золотом наборе по полному корпусу, отслеживается от запуска к запуску. MRR 0.94.