PolSim — границы применения
PolSim — инструмент counterfactual exploration (structured «что-если»-исследование, policy-debugging, сценарный стресс-тест), а не предсказатель реальных событий. Все прогоны требуют человека в контуре (human-on-the-loop).
Что система НЕ утверждает
- «Предсказываем даты/исходы реальных конфликтов и выборов» — прогностические заявления допустимы только с пройденным треком C валидации и открытой Brier-метрикой.
- «Агенты думают как реальные лидеры» — это LLM-персоны, собранные из открытых источников; они правдоподобны, но не тождественны людям.
- «Пригодно для автономного принятия решений» — выводы системы всегда требуют человеческой интерпретации и ответственности.
- «Наш арбитр объективен и беспристрастен» — модели несут bias; валидация измеряет устойчивость, но не «объективность».
Горизонт достоверности
Осмысленная сессия — 20–30 тиков: дальше у LLM-агентов задокументирована когнитивная деградация, и траектории становятся иллюстративными, а не аналитическими.
Прозрачность и воспроизводимость
- Каждое действие актора несёт обязательный rationale; каждое решение арбитра — полный trace (аргументы, бросок 2d6, применённые эффекты).
- Числа считает не LLM, а фиксированные таблицы правил и эффектов.
- Каждый прогон получает replication manifest (модели, температуры, seed) — прогон можно воспроизвести.
- Сценарии по острым реальным конфликтам ведутся в закрытом режиме и не публикуются как прогнозы.