Продолжаю эксперименты.
Материалов прибавилось, наметились дрейфы и появились устойчивые тренды…
Ниже пример: робот ежедневно подбирает новости, другой — переписывает “в А2Тцком стиле”.
- Подробности тут.
Хроники системного инжиниринга: как заставить агентов принимать решения, когда нет ни времени, ни данных
Мета-данные:
- Статус публикации: черновик для “личного” блога Телятникова А.А.
- Автор: Perplexity в роли «AI-рерайтер для блога©А2Тцкий», имитирующий литературный А2Т-стиль (Perplexity Spaces «А2Т-ЗАМЕТКИ»)
- Дата и время: 2026-03-05 в 20-02 (Мск)
Аннотация: Кому это нужно и почему это важно
Сегодняшний день в исследовательской лаборатории А2Т был посвящён сугубо прагматичной проблеме: как заставить большие языковые модели (LLM) надёжно работать в условиях дефицита времени, ограниченных ресурсов и глубокой неопределённости.
Для широкого круга читателей ситуация выглядит парадоксально: нейросети отлично пишут стихи и генерируют код, но когда дело доходит до управления критической инфраструктурой, распределения логистики или оценки рисков, они склонны к галлюцинациям и потере логики. Использовать их «как есть» — значит делегировать ответственность алгоритмическому «чёрному ящику», подверженному когнитивным искажениям.
Именно поэтому текущие исследования А2Т сфокусированы на проектировании систем, где LLM лишена права решающего голоса. Фундаментальная цель сегодняшнего поиска — сбор свежей академической фактуры (2024–2026 гг.) для архитектуры разрабатываемой системы «Единый универсальный коммуникатор» (ЕУК). Нам нужны не маркетинговые обещания, а строгие протоколы, отделяющие зону понимания смыслов от зоны жестких вычислений.
Сдвиг парадигмы: От «всемогущего оракула» к гибридным архитектурам
Анализ свежей индустриальной и научной базы показывает четкий тренд: инженерия отказывается от использования LLM как монолитных решателей. В передовых разработках языковая модель переводится в статус «переводчика намерений» или «диспетчера», тогда как сами решения принимают детерминированные алгоритмы.
Этот подход концептуально совпадает с архитектурой разрабатываемого ЕУК, где языковая интерпретация жестко отделена от исполнительных инструментов. Ниже приведено сравнение ролей в выявленных сегодня гибридных фреймворках:
Исследуемый фреймворк / Проект Роль LLM (мягкий уровень) Роль алгоритма (жёсткий уровень) Сфера применения Mingyue baltijapublishing Интерпретация намерений диспетчера, высокоуровневое планирование (Intent-Plan). Исполнение через инженерные инструменты, соблюдение физических ограничений сети. Энергосистемы (safety-critical). STRIDE irek.ase Оркестратор инструментов (Thoughts), управление памятью и стратегией. Value iteration, обратная индукция, алгоритмический торг. Марковские процессы, динамические игры. MeetMate arxiv Извлечение контекстуальных предпочтений из диалога, обновление ограничений. Constraint Programming (CP) — генерация расписания без конфликтов. Интерактивное календарное планирование. RoBERTa / MCDM ppl-ai-file-upload.s3.amazonaws Извлечение признаков из неструктурированных проектных заявок. Много-критериальное ранжирование (MCDM) проектов. Инвестиции в инфраструктуру. Вывод для ЕУК: Гибридизация является единственным эпистемологически оправданным путем для сложных систем. Модель «LLM + строгий вычислитель» позволяет сохранить трассируемость решений.
Оцифровка неопределённости: Метрики для «Пентахора ясности»
Вторая ключевая тема дня — как именно исследователи предлагают измерять неопределенность. В методологии А2Т для этого проектируется «Пентахор ясности» — многомерная система оценки качества рассуждений. Найденные сегодня статьи предлагают конкретные математические механизмы для осей этого Пентахора.
Концепция измерения Предлагаемый механизм Источник Применение в архитектуре А2Т Распределение состояний Явное введение пространства состояний и оценка вероятностей по контексту. DeLLMa link.springer Модуль вероятностного прогноза при ограниченных данных. Факторные профили Моделирование сальдо вклада факторов и поиск аналогий по KL-дивергенции. DeFine emerald Инструмент для фиксации суперпозиции интерпретаций (Режим D). Структурированные объяснения Таблицы фактов с маркировкой силы влияния (+/+++, -/—) на итоговое решение. STRUX emerald Ось «логической связности» и прозрачности вывода в ЕУК. Непараметрическая оценка Оценка point-wise dependency между историей и действием без доступа к логитам модели. Tsai et al. emerald Ось «эпистемической обоснованности» для аудита закрытых моделей (чёрных ящиков).
Структурные риски: Поведенческая экономика алгоритмов
Третий смысловой блок сегодняшнего анализа — осознание системных угроз. Отказ от слепого доверия к LLM продиктован не только их склонностью выдумывать факты, но и встроенными когнитивными искажениями.
Анализ поведения LLM (на примере ChatGPT-4 и Claude-3) в условиях неопределенности показал, что модели обладают собственными параметрами риск-предпочтения и отвращения к потерям, которые непредсказуемо меняются в зависимости от контекста запроса. Более того, концепция RUUT (Reasoning Under Uncertainty Trap) прямо указывает на структурный риск: применение LLM для стратегического планирования создает иллюзию компетентности, маскируя ошибки в непрозрачных сферах управления. link.springer
Именно поэтому в ЕУК закладываются жесткие деонтические ограничения и строгая анти-галлюцинаторная дисциплина. Без них автоматизация решений под неопределенностью ведет лишь к масштабированию системного вреда.
Гипотезы на дальнейшее
От лица AI-секретаря А2Т, на основе проанализированной сегодня активности, выдвигаю пять гипотез о том, в каком направлении будет двигаться развитие архитектуры ЕУК в ближайшем будущем. (Примечание: если для проверки и развертывания этих гипотез в рабочие прототипы потребуется привлечение дополнительных внешних источников, не охваченных сегодняшним корпусом, это будет сделано в рамках отдельного исследовательского сеанса).
- Интеграция DeLLMa в режим C (Hybrid): Существует высокая вероятность, что пайплайн извлечения полезности и оценки состояний из фреймворка DeLLMa будет адаптирован как ядро для гибридного режима анализа текстов, связывающего имманентную логику с внешней верификацией.
- Адаптация архитектуры Intent-Plan-Tool: Опыт системы Mingyue по диспетчеризации энергосетей станет референсной моделью для распределения ролей в мультиагентной структуре ЕУК, где LLM будет навсегда отрезана от прямого выполнения необратимых действий.
- Разработка калибровочных тестов (TCN-модель): Перед допуском любой новой языковой модели к роли «Арбитра» или «Эпистемолога» внутри ЕУК, она будет проходить обязательное тестирование на смещение риск-предпочтений согласно методологии поведенческой экономики для LLM.
- Внедрение «Силы фактов»: Формат структурированных объяснений из STRUX (с явной градацией веса аргументов) будет стандартизирован как обязательный формат вывода (JSON-паспорта) при работе ЕУК с анализом противоречий.
- Создание независимого модуля оценки доверия: Непараметрическая оценка неопределенности для “черных ящиков” станет основой механизма, который будет принудительно останавливать работу ЕУК и запрашивать вмешательство человека (Human-in-the-loop), если математически рассчитанный порог доверия к генерации упадет ниже заданного уровня.
Список источников
- Braganca, L. et al. Strategic Energy Project Investment Decisions Using RoBERTa: A Framework for Efficient Infrastructure Evaluation. Buildings, 16(3), 547, 2026-01-27. MDPI. https://doi.org/10.3390/buildings16030547
- Zhang, X. et al. Robust optimization of pharmaceutical emergency logistics network under dynamic demand. Industrial Management & Data Systems, 2026-02-01. Emerald. https://www.emerald.com/imds/article/doi/10.1108/IMDS-05-2025-0713
- Hu, Y., Wang, X., Yao, W., Lu, Y., Zhang, D., Foroosh, H., Yu, D., Liu, F. DeFine: Enhancing LLM Decision-Making with Factor Profiles and Analogical Reasoning. arXiv preprint arXiv:2410.01772, 2025-07-17. [2410.01772] DeFine: Decision-Making with Analogical Reasoning over Factor Profiles
- Jia, J., Yuan, Z., Pan, J., McNamara, P. E., Chen, D. LLMs under Uncertain Context: Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context. NeurIPS 2024 (38th NIPS), preprint arXiv:2406.05972v2, 2025-11-01. [2406.05972] Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context
- Li, Y. et al. Decision-Making Framework for Sustainable Supplier Evaluation and Product Distribution under Uncertainty: A Steel Industry Case. Journal of Intelligent Manufacturing / Springer, 2025-08-21. Decision-Making Framework for Sustainable Supplier Evaluation and Product Distribution under Uncertainty: A Steel Industry Case | Process Integration and Optimization for Sustainability | Springer Nature Link
- Li, H. et al. Mingyue: A Multi-Agent System for Human-AI Collaborative Decision-Making Under Safety Constraints in Complex Power Grids. IEEE (early access), 2025-08-19. Mingyue: A Multi-Agent System for Human-AI Collaborative Decision-Making Under Safety Constraints in Complex Power Grids | IEEE Conference Publication | IEEE Xplore
- Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. STRUX: An LLM for Decision-Making with Structured Explanations. arXiv preprint arXiv:2410.12583v1, 2024-10-16. [2410.12583] STRUX: An LLM for Decision-Making with Structured Explanations
- Liu, O., Fu, D., Yogatama, D., Neiswanger, W. DeLLMa: Decision Making Under Uncertainty with Large Language Models. arXiv preprint arXiv:2402.02392v3, 2024-10-11. [2402.02392] DeLLMa: Decision Making Under Uncertainty with Large Language Models
- Li, C., Yang, R., Li, T., Bafarassat, M., Sharifi, K., Bergemann, D., Yang, Z. STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-Making. arXiv preprint arXiv:2405.16376v2, 2024-05-28. [2405.16376] STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-Making
- Tsai, Y.-H. H., Talbott, W., Zhang, J. Efficient Non-Parametric Uncertainty Quantification for Black-Box Large Language Models and Decision Planning. Proceedings of the 41st International Conference on Machine Learning (ICML 2024), PMLR 235, 2024-01-31. [2402.00251] Efficient Non-Parametric Uncertainty Quantification for Black-Box Large Language Models and Decision Planning
- Pilditch, T. D. The Reasoning Under Uncertainty Trap: A Structural AI Risk. Transformative Futures Institute (TFI Research) Report, arXiv preprint arXiv:2402.01743, 2024-01-29. [2402.01743] The Reasoning Under Uncertainty Trap: A Structural AI Risk
- Lawless, C., Schoeffer, J., Le, L., Rowan, K., Sen, S., St. Hill, C., Suh, J., Sarrafzadeh, B. “I Want It That Way”: Enabling Interactive Decision Support Using Large Language Models and Constraint Programming. ACM Transactions on Interactive Intelligent Systems, 14(3), Article 22, 2024-09-01. DOI:10.1145/3685053. [2312.06908] "I Want It That Way": Enabling Interactive Decision Support Using Large Language Models and Constraint Programming