Нейросеть сегодня можно попросить спрогнозировать практически любой футбольный матч. ChatGPT, Claude, Gemini, DeepSeek, Grok, Qwen и другие модели без особых проблем назовут предполагаемого победителя, предложат тотал или фору и объяснят, почему считают именно этот вариант наиболее вероятным.
Проблема начинается позже — когда хочется понять, насколько хорошо такие прогнозы работают на самом деле.
Отдельный удачный прогноз ничего не показывает. Даже серия из пяти или шести попаданий подряд может оказаться обычным совпадением. Особенно если после матча мы помним удачные рекомендации и быстро забываем те, которые не зашли.
Поэтому мы решили провести максимально простой эксперимент: не выбирать лучшие прогнозы нейросетей, а записывать вообще все.
Как устроен эксперимент
Перед матчами несколько моделей получают одну и ту же задачу. Каждая должна выбрать конкретный вариант ставки на матч.
После этого прогноз фиксируется вместе с коэффициентом. Когда игра заканчивается, ставка получает результат: выигрыш, проигрыш или возврат.
Задним числом ничего не меняется.
Это принципиальный момент. Если модель дала неудачный прогноз, он остаётся в статистике точно так же, как удачный.
Постепенно получается довольно большая база, на которой уже можно смотреть не отдельные красивые попадания, а реальную дистанцию.
Сейчас в сравнении участвуют ChatGPT, Claude, Gemini, DeepSeek, Grok, Qwen, Kimi и другие модели. Всего одновременно может голосовать больше десятка нейросетей.
Процент попаданий — не главное
На первый взгляд кажется, что сравнивать нейросети проще всего по количеству угаданных ставок.
Например, одна модель дала 100 прогнозов и угадала 65. Другая угадала только 55. Значит первая лучше?
Не обязательно.
Большое значение имеют коэффициенты. Можно постоянно выбирать события с коэффициентами 1.25–1.35 и иметь высокий процент попаданий, но при нескольких неудачах всё равно оказаться в минусе.
Поэтому кроме количества выигранных прогнозов мы считаем условную прибыль при одинаковой ставке на каждый матч и ROI.
Так результаты становятся намного интереснее. Иногда модель с меньшим процентом попаданий оказывается прибыльнее той, которая угадывает чаще.
Один идеальный вечер ещё ничего не доказывает
Хороший пример произошёл в Лиге чемпионов.
На шесть матчей нейросети выбрали шесть основных вариантов — и в тот вечер зашли все шесть.
- Ливерпуль — Атлетико: обе забьют.
- ПСЖ — Слован: фора ПСЖ.
- Наполи — Арсенал: победа Арсенала.
- Спортинг — Галатасарай: победа Спортинга.
- Барселона — Фейеноорд: фора Барселоны.
- Штутгарт — Викинг: фора Штутгарта.
Получилось эффектно: 6 из 6 за один игровой день.
Но именно такие результаты особенно легко переоценить.
Если после этого написать, что нейросети научились идеально прогнозировать футбол, это будет примерно то же самое, что объявить игрока профессионалом после одного удачного экспресса.
На длинной дистанции картина быстро становится сложнее.
Какие-то модели уходят в плюс, другие постепенно теряют первоначальное преимущество. У кого-то хорошо проходят форы, но плохо тоталы. У кого-то высокий процент выигранных ставок, но из-за низких коэффициентов итоговая прибыль оказывается небольшой.
Нейросети ошибаются по-разному
Это, пожалуй, одна из самых интересных частей эксперимента.
Когда прогнозов становится много, можно смотреть не только на общую прибыль модели, но и на то, какие рынки ей даются лучше.
Например, отдельно сравнивать:
- форы;
- тоталы;
- исходы матчей;
- двойной шанс;
- ставки на обе забьют.
Может оказаться, что модель довольно посредственно определяет победителя, но лучше видит матчи, где фаворит не должен проиграть. Или наоборот — хорошо оценивает исходы, но регулярно ошибается с количеством голов.
На небольшой выборке делать серьёзные выводы рано, но по мере накопления нескольких сотен и тысяч прогнозов такие различия уже становится интересно отслеживать.
А если объединить прогнозы разных моделей?
Есть ещё один вариант — вообще не выбирать «лучшую» нейросеть.
Если один и тот же матч разбирают 12–15 моделей, можно посмотреть, какой прогноз встречается чаще всего.
Получается своеобразное голосование нейросетей.
Например, если большинство моделей независимо друг от друга выбирают один и тот же тотал или фору, этот вариант становится итоговым прогнозом.
При этом особенно интересны матчи, где модели полностью расходятся. Иногда половина считает фаворита слишком переоценённым, а другая половина уверенно ждёт его победу.
Такие игры хорошо показывают, насколько условным вообще может быть любой прогноз.
Сколько матчей нужно, чтобы делать выводы
Наверное, главный вопрос во всём эксперименте — дистанция.
Десять прогнозов не показывают почти ничего.
Пятьдесят уже позволяют заметить какие-то тенденции, но результат всё ещё легко может сильно измениться.
Даже после нескольких сотен ставок невозможно гарантировать, что текущий лидер таблицы останется наверху.
Поэтому здесь интереснее не искать нейросеть, которая «точно умеет ставить», а просто наблюдать за тем, как меняются результаты по мере накопления данных.
Сегодня одна модель может быть первой, через месяц уйти в середину таблицы, а ещё через несколько туров снова подняться.
Именно поэтому все прогнозы важно сохранять.
Что получится через несколько месяцев
Если продолжать такой эксперимент достаточно долго, можно будет ответить уже на более интересные вопросы.
Есть ли вообще у нейросетей стабильное преимущество над обычным выбором фаворита?
Какие модели лучше справляются с футбольными матчами?
Какие типы ставок показывают лучший результат?
Работает ли коллективное голосование моделей лучше отдельных прогнозов?
И самое главное — сохраняются ли первоначальные результаты на большой дистанции?
Пока ответов на эти вопросы нет. Есть только постоянно растущая статистика.
Мы продолжаем фиксировать новые прогнозы перед матчами и не удаляем неудачные результаты. В Telegram публикуются свежие игровые дни, серии, промежуточные результаты моделей и изменения в общей таблице.
Через несколько сотен новых матчей будет особенно интересно вернуться к первым результатам и посмотреть, насколько сильно всё изменилось.