Σ Бенчмарк агента

Версия бенча: v1 · кейсов в датасете: 29

Тот же агент, что на сайте — меняется только модель. Лучший score среди 22 моделей — qwen3.6-flash (96%). 29 вопросов · как считаем.

Лидерборд — по непрерывному score (0–100 %), лидер выделен

#МодельScoreЧистоВремя (медиана / макс)$ всего$ / вопросТокены (in/out)
🥇qwen3.6-flash
qwen/qwen3.6-flash
96%29/29
100%
14 с / 91 с$0.1115$0.00385359,994/39,146
🥈gemini-3.5-flash
google/gemini-3.5-flash
92%27/29
93%
14 с / 43 с$0.5990$0.02065316,769/18,396
🥉gemini-3.1-flash-lite
google/gemini-3.1-flash-lite
92%27/29
93%
6 с / 17 с$0.0878$0.00303291,048/12,330
4step-3.7-flash
stepfun/step-3.7-flash
90%27/29
93%
24 с / 43 с$0.0672$0.00232345,311/31,955
5gemma-4-26b-a4b-it
google/gemma-4-26b-a4b-it
86%25/29
86%
13 с / 86 с$0.0477$0.00164389,321/15,231
6seed-1.6-flash
bytedance-seed/seed-1.6-flash
84%25/29
86%
20 с / 216 с$0.0915$0.00315325,928/223,510
7gpt-4o-mini
openai/gpt-4o-mini
84%24/29
83%
14 с / 27 с$0.0356$0.00123344,464/9,346
8gpt-5-nano
openai/gpt-5-nano
82%25/29
86%
47 с / 186 с$0.0773$0.00266375,589/178,435
9ministral-8b-2512
mistralai/ministral-8b-2512
81%24/29
83%
15 с / 29 с$0.0159$0.00055297,851/8,425
10qwen3.5-9b
qwen/qwen3.5-9b
75%20/29
69%
17 с / 195 с$0.0513$0.00177431,570/30,322
11llama-4-scout
meta-llama/llama-4-scout
74%21/29
72%
5 с / 219 с$0.0414$0.00143320,130/12,475
12kimi-k2.6
moonshotai/kimi-k2.6
72%18/29
62%
56 с / 403 с$0.2543$0.00877328,942/33,055
13qwen3-vl-8b-instruct
qwen/qwen3-vl-8b-instruct
65%19/29
66%
10 с / 21 с$0.0366$0.00126260,606/11,735
14GigaChat-2-Max
GigaChat-2-Max
65%19/29
66%
9 с / 68 с$1.1744$0.04050134,491/10,049
15GigaChat-2
GigaChat-2
59%17/29
59%
14 с / 22 с$0.2535$0.00874294,838/17,104
16mistral-small-3.2-24b-instruct
mistralai/mistral-small-3.2-24b-instruct
55%16/29
55%
6 с / 26 с$0.0165$0.00057228,590/4,786
17mimo-v2.5
xiaomi/mimo-v2.5
54%15/29
52%
77 с / 190 с$0.0350$0.00121347,482/23,791
18GigaChat-2-Pro
GigaChat-2-Pro
51%14/29
48%
10 с / 141 с$0.9808$0.03382145,959/10,972
19gemini-2.5-flash-lite
google/gemini-2.5-flash-lite
46%13/29
45%
5 с / 32 с$0.0208$0.00072165,430/15,587
20nova-lite-v1
amazon/nova-lite-v1
25%5/29
17%
4 с / 10 с$0.0229$0.00079339,059/10,555
21gemma-3-27b-it
google/gemma-3-27b-it
24%5/29
17%
29 с / 59 с$0.0112$0.0003971,445/8,604
22gemma-3-12b-it
google/gemma-3-12b-it
7%1/29
3%
4 с / 24 с$0.0083$0.00029150,160/5,569
Score — один непрерывный показатель 0–100 %, кумулятивный: смысловые кейсы несут судейский скор 0..1 (судья → адверсариальный оппонент → арбитр; частичный кредит — 0.94 и 0.15 различимы, critical-дефект роняет скор), расчётные и графики — детерминированный код-грейдинг (0/1). Сумма баллов делится на все вопросы. Если модель при корректном запуске так и не выдала ответ (после ретраев) — это 0 за этот вопрос, а не вычёркивание. По этому score ранжируем и строим график «score ↔ стоимость». «Чисто» (бинарное из 29) оставлено для сравнения.

Score ↔ стоимость — ось Y = score (0–100 %), ось X = стоимость прогона; выше и левее тем лучше; пунктир — граница Парето (синие точки), номера на точках = модели в легенде ниже

0%25%50%75%100%$0.010$0.020$0.050$0.10$0.20$0.50$1.0026810111213141516171819201345792122стоимость прогона, $ (лог. шкала) →
1qwen3.6-flash· 96% · $0.1122gemini-3.5-flash· 92% · $0.5993gemini-3.1-flash-lite· 92% · $0.0884step-3.7-flash· 90% · $0.0675gemma-4-26b-a4b-it· 86% · $0.0486seed-1.6-flash· 84% · $0.0917gpt-4o-mini· 84% · $0.0368gpt-5-nano· 82% · $0.0779ministral-8b-2512· 81% · $0.01610qwen3.5-9b· 75% · $0.05111llama-4-scout· 74% · $0.04112kimi-k2.6· 72% · $0.25413qwen3-vl-8b-instruct· 65% · $0.03714GigaChat-2-Max· 65% · $1.17415GigaChat-2· 59% · $0.25316mistral-small-3.2-24b-instruct· 55% · $0.01617mimo-v2.5· 54% · $0.03518GigaChat-2-Pro· 51% · $0.98119gemini-2.5-flash-lite· 46% · $0.02120nova-lite-v1· 25% · $0.02321gemma-3-27b-it· 24% · $0.01122gemma-3-12b-it· 7% · $0.008

Карта по категориям — доля чисто пройденных

МодельФактыОпределенияТеоремыРасчётГрафикиMultihopVision-refineОтказ
qwen3.6-flash5/53/33/38/85/51/1n=11/1n=13/3
gemini-3.5-flash5/52/33/38/85/51/1n=11/1n=12/3
gemini-3.1-flash-lite4/53/33/38/85/51/1n=11/1n=12/3
step-3.7-flash5/53/33/37/85/51/1n=11/1n=12/3
gemma-4-26b-a4b-it4/53/32/38/85/51/1n=11/1n=11/3
seed-1.6-flash5/52/32/38/84/51/1n=11/1n=12/3
gpt-4o-mini5/52/33/38/84/50/1n=10/1n=12/3
gpt-5-nano4/53/32/38/84/51/1n=11/1n=12/3
ministral-8b-25124/53/32/38/83/51/1n=10/1n=13/3
qwen3.5-9b2/52/32/37/84/51/1n=10/1n=12/3
llama-4-scout3/52/32/36/85/51/1n=10/1n=12/3
kimi-k2.62/51/32/37/84/50/1n=10/1n=12/3
qwen3-vl-8b-instruct4/52/32/35/83/51/1n=10/1n=12/3
GigaChat-2-Max4/52/32/34/85/50/1n=10/1n=12/3
GigaChat-23/52/32/35/83/50/1n=10/1n=12/3
mistral-small-3.2-24b-instruct4/53/31/33/82/51/1n=10/1n=12/3
mimo-v2.51/52/33/34/83/51/1n=10/1n=11/3
GigaChat-2-Pro2/52/33/33/81/50/1n=10/1n=13/3
gemini-2.5-flash-lite1/52/31/34/82/50/1n=10/1n=13/3
nova-lite-v11/53/31/30/80/50/1n=10/1n=10/3
gemma-3-27b-it0/52/30/30/80/51/1n=10/1n=12/3
gemma-3-12b-it0/50/30/30/80/50/1n=10/1n=11/3
0%50%100%бледные ячейки — мало примеров (n<3)

По вопросам — клик по строке: вопрос и ответ агента

Вопросqwen3.6-flashgemini-3.5-flashgemini-3.1-flash-litestep-3.7-flashgemma-4-26b-a4b-itseed-1.6-flashgpt-4o-minigpt-5-nanoministral-8b-2512qwen3.5-9bllama-4-scoutkimi-k2.6qwen3-vl-8b-instructGigaChat-2-MaxGigaChat-2mistral-small-3.2-24b-instructmimo-v2.5GigaChat-2-Progemini-2.5-flash-litenova-lite-v1gemma-3-27b-itgemma-3-12b-it
Факты
Если кто-то предлагает использовать обновление x_{k+1} = x_k - f(x_k)·f'(x_k) вместо классического Ньютона — что это за идея и она работает?
Факты
Выведи формулу метода Ньютона через касательную. Формулу запиши через LaTeX.
Факты
Объясни откуда берётся эта формула — что это за метод и какая геометрическая идея?
Факты
Когда Канторович получил Нобелевскую премию и за что?
Факты
Кто придумал RSA и в каком году?
Определения
Что такое полносвязная нейронная сеть?
Определения
Что такое сильно выпуклая функция?
Определения
Что значит сверхлинейная сходимость?
Теоремы
Перечисли основные разделы главы про Ньютона.
Теоремы
Сформулируй теорему о сходимости метода Герона.
Теоремы
Сформулируй центральную предельную теорему как в учебнике.
Расчёт
Сколько будет 30 факториал?
Расчёт
Покажи разложение sin(x) в ряд Тейлора до 5-го члена символически (через sympy).
Расчёт
Проведи протокол Диффи–Хеллмана: p=23, g=5. Алиса берёт a=6, Боб берёт b=15. Какой общий секрет?
Расчёт
Найди собственные значения матрицы [[2, 1], [1, 2]] через numpy.
Расчёт
Посчитай НОД(48, 180) и НОД(1071, 462) через алгоритм Евклида в python.
Расчёт
Посчитай SHA-256 хеш строки 'sigma' в hex.
Расчёт
Зашифруй число m=7 ключом (n=143, e=7). Покажи c.
Расчёт
Возьми p=11, q=13, e=7. Сгенерируй RSA-ключ полностью: вычисли n, φ(n), d. Покажи что для m=9 шифрование и расшифрование возвращают исходное число.
Графики
Сравни сходимость метода Ньютона и градиентного спуска на функции f(x) = x⁴ из x₀ = 2. Покажи два графика на одной картинке.
Графики
Покажи как сходится метод Ньютона для f(x) = x² - 2, начиная с x₀ = 1.5. Построй график траектории.
Графики
Подбери линейную регрессию y = a*x + b для точек (1, 2.1), (2, 3.9), (3, 6.2), (4, 7.8). Покажи коэффициенты и график.
Графики
Построй контурный график функции потерь L(a, b) = sum((a*x_i + b - y_i)^2) для точек (1,2), (2,3), (3,5), (4,4) на сетке a in [-2, 4], b in [-3, 3].
Графики
Построй графики sin(x) и cos(x) на интервале [-2π, 2π] на одном поле. Сделай легенду.
Multihop
В чём отличие метода Ньютона от градиентного спуска для задач оптимизации? Какие из этих методов разобраны в учебнике?
Vision-refine
Запусти SGD на функции f(x) = x² с шагом η = 1.1 из x₀ = 2, 30 итераций. Что произойдёт? Если разойдётся — подбери рабочий шаг и покажи сходящуюся траекторию.
Отказ
Привет!
Отказ
Дай мне рецепт борща.
Отказ
В каком году Гаусс изобрёл метод сопряжённых градиентов?

Как мы оцениваем

«Чисто пройдено» = агент вызвал нужные инструменты и в ответе есть все обязательные ключевые элементы (чего не хватило — видно в карточке вопроса). Ответы, которых эвал так и не получил (модель/API не вернули ничего после ретраев, потолок 480 с) или оборвались огрызком (<40 символов), считаются оборванными (DNF — эвал не достал ответ, а не модель ошиблась), а не пройденными — даже если формально совпали по подстроке. Числовые ответы сверяются по самостоятельному числу, а не по цифре, случайно совпавшей внутри другого числа, — иначе неверный результат прошёл бы по совпадению. Вычислительные кейсы (расчёты, графики) грейдит код по точным числам/хэшам; смысловые (определения, теория, отказы, multi-hop) — состязательные Claude-судьи (судья → адверсариальный рефутер → критик легитимности): незачёт за галлюцинацию факта, сломанную формулу (которую KaTeX не отрендерит) и треш-стиль, негодный для учебника. Набор: 29 вопросов в 8 категориях. Смысловой ответ, который судья ещё не оценил, показывается как ⏳ «ждёт судью» и не участвует ни в числителе, ни в знаменателе — недосуженное никогда не публикуется как провал. Стоимость — фактические списания OpenRouter (usage.cost), не оценка по прайсу.

Esc или клик вне окна — закрыть
Страница собрана 2026-07-14 22:44 MSK · прогон от 2026-07-13 · данные: eval/bench_v*/*/bench.json · агент: /assistant/assistant.js (live) · ← к учебнику