ИИ научился предсказывать споры на рынках прогнозов

Сокращённое изложение статьи Free Systems, 16 июля 2026.

Авторы построили ИИ, который читает контракты и по одной лишь чёткости текста предсказывает, какие из них закончатся спором.

Гипотеза: политический сверхразум

Авторы развивают идею «политического сверхразума» — по мере того как ИИ удешевляет интеллект, его можно направить на улучшение работы демократии.

Идеально написанный контракт не предугадает крупных сдвигов будущего и не решит проблему несовершенного исполнения, но может ли ИИ хотя бы убрать двусмысленности из важных письменных соглашений?

Для проверки требовалось место, где можно быстро собрать много контрактов и увидеть, какие из них дошли до спора. Далеко ходить не пришлось: рынки прогнозов — любимый полигон Free Systems, а Калши и Полимаркет публикуют правила для каждого контракта.

Как ИИ учили оценивать текст контрактов

Авторы собрали выборку из 10 тыс. правил разрешения контрактов с Калши и Полимаркета вместе с данными о том, какие контракты в итоге оспаривались.

Вместе с Claude авторы разработали рубрикатор из десяти измерений, покрывающих типичные дефекты контрактов: не указан источник истины, сущность названа недостаточно точно и т.д. Каждое измерение оценивается от 0 (полная ясность) до 3 (серьёзная двусмысленность). Затем большую выборку контрактов — со смещением в сторону оспоренных, потому что диспуты на рынках прогнозов редки — прогнали через LLM (GPT-4.1, ради экономии).

Результат: спор виден в тексте заранее

Чтобы проверить, предсказывают ли оценки диспуты, авторы с помощью Fable в Claude Code перебрали несколько методов машинного обучения. Лучшим на внеконтекстных данных оказался градиентный бустинг.

Метрика AUC показывает, как часто модель из пары контрактов (один оспорен, другой нет) верно угадывает оспоренный — примерно 3 раза из 4. Это на удивление сильный сигнал, извлечённый из одного лишь текста правил.

Из модели можно вытащить и предиктивные признаки. Выделяются три: размыто сформулирован сам вопрос контракта; неясно, какая сущность засчитывается; не указан источник финального расчёта.

Возможно, это просто типичные ошибки наспех написанных контрактов, и платформам стоит чётче определять вопрос, сущности и источники.

Но авторы допускают и обратную причинность: события, которые трудно разрешить, могут быть по своей природе труднее и для написания правил. Это вопрос дальнейших исследований — а пока модель как минимум подсвечивает слабые места контракта до его публикации.

Рейтинги для контрактов рынков прогнозов

Инвесторы привыкли оценивать активы по грейдам качества. По предсказанной вероятности диспута авторы разбили контракты на рейтинговые корзины: грейд «A» — минимальный риск оспаривания, и с каждой ступенью ниже риск растёт.

Контракты уровня «CCC» оспариваются в 3,4 раза чаще, чем контракты «A». Такая шкала может стать началом «рейтинговой системы» для контрактов рынков прогнозов — и заодно источником конкретных рекомендаций по улучшению правил будущих контрактов.

Далее исследователи собираются провести по-настоящему внеконтекстный тест — оценить контракты, которые ещё не разрешились, — на случай, если LLM-грейдер подмешивает в оценки знание о реальных диспутах. Нужна репликация на других доменах. И нужен следующий шаг: чтобы ИИ не только находил слабости, но и переписывал контракты.

Направление тем не менее просматривается ясно. Базовый акт управления — написание правил и толкование их, когда реальность усложняется, — всю историю человечества опирался на дефицитное, дорогое и небезошибочное человеческое суждение, и это ограничение незаметно определяло, какие институты мы вообще могли строить.

ИИ его ослабляет. Если модель, читая правила резолюции, видит будущий спор в трёх случаях из четырёх, тот же интеллект, направленный на законы, платформенные политики и договоры, поможет писать соглашения, которые реже ломаются.