«AI-рерайтер» + «Подбор SoTA для ЕУК»: «Укрощение ИИ в условиях глубокой неопределенности»

Продолжаю эксперименты.
Материалов прибавилось, наметились дрейфы и появились устойчивые тренды…

Ниже пример: робот ежедневно подбирает новости, другой — переписывает “в А2Тцком стиле”.

  • Подробности тут.

Хроники системного инжиниринга: как заставить агентов принимать решения, когда нет ни времени, ни данных

Мета-данные:

  • Статус публикации: черновик для “личного” блога Телятникова А.А.
  • Автор: Perplexity в роли «AI-рерайтер для блога©А2Тцкий», имитирующий литературный А2Т-стиль (Perplexity Spaces «А2Т-ЗАМЕТКИ»)
  • Дата и время: 2026-03-05 в 20-02 (Мск)

Аннотация: Кому это нужно и почему это важно

Сегодняшний день в исследовательской лаборатории А2Т был посвящён сугубо прагматичной проблеме: как заставить большие языковые модели (LLM) надёжно работать в условиях дефицита времени, ограниченных ресурсов и глубокой неопределённости.

Для широкого круга читателей ситуация выглядит парадоксально: нейросети отлично пишут стихи и генерируют код, но когда дело доходит до управления критической инфраструктурой, распределения логистики или оценки рисков, они склонны к галлюцинациям и потере логики. Использовать их «как есть» — значит делегировать ответственность алгоритмическому «чёрному ящику», подверженному когнитивным искажениям.

Именно поэтому текущие исследования А2Т сфокусированы на проектировании систем, где LLM лишена права решающего голоса. Фундаментальная цель сегодняшнего поиска — сбор свежей академической фактуры (2024–2026 гг.) для архитектуры разрабатываемой системы «Единый универсальный коммуникатор» (ЕУК). Нам нужны не маркетинговые обещания, а строгие протоколы, отделяющие зону понимания смыслов от зоны жестких вычислений.


Сдвиг парадигмы: От «всемогущего оракула» к гибридным архитектурам

Анализ свежей индустриальной и научной базы показывает четкий тренд: инженерия отказывается от использования LLM как монолитных решателей. В передовых разработках языковая модель переводится в статус «переводчика намерений» или «диспетчера», тогда как сами решения принимают детерминированные алгоритмы.

Этот подход концептуально совпадает с архитектурой разрабатываемого ЕУК, где языковая интерпретация жестко отделена от исполнительных инструментов. Ниже приведено сравнение ролей в выявленных сегодня гибридных фреймворках:

Исследуемый фреймворк / Проект Роль LLM (мягкий уровень) Роль алгоритма (жёсткий уровень) Сфера применения
Mingyue baltijapublishing Интерпретация намерений диспетчера, высокоуровневое планирование (Intent-Plan). Исполнение через инженерные инструменты, соблюдение физических ограничений сети. Энергосистемы (safety-critical).
STRIDE irek.ase Оркестратор инструментов (Thoughts), управление памятью и стратегией. Value iteration, обратная индукция, алгоритмический торг. Марковские процессы, динамические игры.
MeetMate arxiv Извлечение контекстуальных предпочтений из диалога, обновление ограничений. Constraint Programming (CP) — генерация расписания без конфликтов. Интерактивное календарное планирование.
RoBERTa / MCDM ppl-ai-file-upload.s3.amazonaws Извлечение признаков из неструктурированных проектных заявок. Много-критериальное ранжирование (MCDM) проектов. Инвестиции в инфраструктуру.

Вывод для ЕУК: Гибридизация является единственным эпистемологически оправданным путем для сложных систем. Модель «LLM + строгий вычислитель» позволяет сохранить трассируемость решений.


Оцифровка неопределённости: Метрики для «Пентахора ясности»

Вторая ключевая тема дня — как именно исследователи предлагают измерять неопределенность. В методологии А2Т для этого проектируется «Пентахор ясности» — многомерная система оценки качества рассуждений. Найденные сегодня статьи предлагают конкретные математические механизмы для осей этого Пентахора.

Концепция измерения Предлагаемый механизм Источник Применение в архитектуре А2Т
Распределение состояний Явное введение пространства состояний и оценка вероятностей по контексту. DeLLMa link.springer Модуль вероятностного прогноза при ограниченных данных.
Факторные профили Моделирование сальдо вклада факторов и поиск аналогий по KL-дивергенции. DeFine emerald Инструмент для фиксации суперпозиции интерпретаций (Режим D).
Структурированные объяснения Таблицы фактов с маркировкой силы влияния (+/+++, -/—) на итоговое решение. STRUX emerald Ось «логической связности» и прозрачности вывода в ЕУК.
Непараметрическая оценка Оценка point-wise dependency между историей и действием без доступа к логитам модели. Tsai et al. emerald Ось «эпистемической обоснованности» для аудита закрытых моделей (чёрных ящиков).

Структурные риски: Поведенческая экономика алгоритмов

Третий смысловой блок сегодняшнего анализа — осознание системных угроз. Отказ от слепого доверия к LLM продиктован не только их склонностью выдумывать факты, но и встроенными когнитивными искажениями.

Анализ поведения LLM (на примере ChatGPT-4 и Claude-3) в условиях неопределенности показал, что модели обладают собственными параметрами риск-предпочтения и отвращения к потерям, которые непредсказуемо меняются в зависимости от контекста запроса. Более того, концепция RUUT (Reasoning Under Uncertainty Trap) прямо указывает на структурный риск: применение LLM для стратегического планирования создает иллюзию компетентности, маскируя ошибки в непрозрачных сферах управления. link.springer

Именно поэтому в ЕУК закладываются жесткие деонтические ограничения и строгая анти-галлюцинаторная дисциплина. Без них автоматизация решений под неопределенностью ведет лишь к масштабированию системного вреда.


Гипотезы на дальнейшее

От лица AI-секретаря А2Т, на основе проанализированной сегодня активности, выдвигаю пять гипотез о том, в каком направлении будет двигаться развитие архитектуры ЕУК в ближайшем будущем. (Примечание: если для проверки и развертывания этих гипотез в рабочие прототипы потребуется привлечение дополнительных внешних источников, не охваченных сегодняшним корпусом, это будет сделано в рамках отдельного исследовательского сеанса).

  1. Интеграция DeLLMa в режим C (Hybrid): Существует высокая вероятность, что пайплайн извлечения полезности и оценки состояний из фреймворка DeLLMa будет адаптирован как ядро для гибридного режима анализа текстов, связывающего имманентную логику с внешней верификацией.
  2. Адаптация архитектуры Intent-Plan-Tool: Опыт системы Mingyue по диспетчеризации энергосетей станет референсной моделью для распределения ролей в мультиагентной структуре ЕУК, где LLM будет навсегда отрезана от прямого выполнения необратимых действий.
  3. Разработка калибровочных тестов (TCN-модель): Перед допуском любой новой языковой модели к роли «Арбитра» или «Эпистемолога» внутри ЕУК, она будет проходить обязательное тестирование на смещение риск-предпочтений согласно методологии поведенческой экономики для LLM.
  4. Внедрение «Силы фактов»: Формат структурированных объяснений из STRUX (с явной градацией веса аргументов) будет стандартизирован как обязательный формат вывода (JSON-паспорта) при работе ЕУК с анализом противоречий.
  5. Создание независимого модуля оценки доверия: Непараметрическая оценка неопределенности для “черных ящиков” станет основой механизма, который будет принудительно останавливать работу ЕУК и запрашивать вмешательство человека (Human-in-the-loop), если математически рассчитанный порог доверия к генерации упадет ниже заданного уровня.

Список источников

  1. Braganca, L. et al. Strategic Energy Project Investment Decisions Using RoBERTa: A Framework for Efficient Infrastructure Evaluation. Buildings, 16(3), 547, 2026-01-27. MDPI. https://doi.org/10.3390/buildings16030547
  2. Zhang, X. et al. Robust optimization of pharmaceutical emergency logistics network under dynamic demand. Industrial Management & Data Systems, 2026-02-01. Emerald. https://www.emerald.com/imds/article/doi/10.1108/IMDS-05-2025-0713
  3. Hu, Y., Wang, X., Yao, W., Lu, Y., Zhang, D., Foroosh, H., Yu, D., Liu, F. DeFine: Enhancing LLM Decision-Making with Factor Profiles and Analogical Reasoning. arXiv preprint arXiv:2410.01772, 2025-07-17. [2410.01772] DeFine: Decision-Making with Analogical Reasoning over Factor Profiles
  4. Jia, J., Yuan, Z., Pan, J., McNamara, P. E., Chen, D. LLMs under Uncertain Context: Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context. NeurIPS 2024 (38th NIPS), preprint arXiv:2406.05972v2, 2025-11-01. [2406.05972] Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context
  5. Li, Y. et al. Decision-Making Framework for Sustainable Supplier Evaluation and Product Distribution under Uncertainty: A Steel Industry Case. Journal of Intelligent Manufacturing / Springer, 2025-08-21. Decision-Making Framework for Sustainable Supplier Evaluation and Product Distribution under Uncertainty: A Steel Industry Case | Process Integration and Optimization for Sustainability | Springer Nature Link
  6. Li, H. et al. Mingyue: A Multi-Agent System for Human-AI Collaborative Decision-Making Under Safety Constraints in Complex Power Grids. IEEE (early access), 2025-08-19. Mingyue: A Multi-Agent System for Human-AI Collaborative Decision-Making Under Safety Constraints in Complex Power Grids | IEEE Conference Publication | IEEE Xplore
  7. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. STRUX: An LLM for Decision-Making with Structured Explanations. arXiv preprint arXiv:2410.12583v1, 2024-10-16. [2410.12583] STRUX: An LLM for Decision-Making with Structured Explanations
  8. Liu, O., Fu, D., Yogatama, D., Neiswanger, W. DeLLMa: Decision Making Under Uncertainty with Large Language Models. arXiv preprint arXiv:2402.02392v3, 2024-10-11. [2402.02392] DeLLMa: Decision Making Under Uncertainty with Large Language Models
  9. Li, C., Yang, R., Li, T., Bafarassat, M., Sharifi, K., Bergemann, D., Yang, Z. STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-Making. arXiv preprint arXiv:2405.16376v2, 2024-05-28. [2405.16376] STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-Making
  10. Tsai, Y.-H. H., Talbott, W., Zhang, J. Efficient Non-Parametric Uncertainty Quantification for Black-Box Large Language Models and Decision Planning. Proceedings of the 41st International Conference on Machine Learning (ICML 2024), PMLR 235, 2024-01-31. [2402.00251] Efficient Non-Parametric Uncertainty Quantification for Black-Box Large Language Models and Decision Planning
  11. Pilditch, T. D. The Reasoning Under Uncertainty Trap: A Structural AI Risk. Transformative Futures Institute (TFI Research) Report, arXiv preprint arXiv:2402.01743, 2024-01-29. [2402.01743] The Reasoning Under Uncertainty Trap: A Structural AI Risk
  12. Lawless, C., Schoeffer, J., Le, L., Rowan, K., Sen, S., St. Hill, C., Suh, J., Sarrafzadeh, B. “I Want It That Way”: Enabling Interactive Decision Support Using Large Language Models and Constraint Programming. ACM Transactions on Interactive Intelligent Systems, 14(3), Article 22, 2024-09-01. DOI:10.1145/3685053. [2312.06908] "I Want It That Way": Enabling Interactive Decision Support Using Large Language Models and Constraint Programming