Lytdybr от 8 августа 2026

Взял 5 августа вторую подписку ChatGPT Pro (долго размышляя, стоит ли мне экспериментировать с Qwen 3.8, ибо “все побежали, и я побежал”, но я таки не побежал). Со второй подпиской для увеличения квоты на каждом шагу пугали, что это “серая зона” – обходить квоту так нельзя, но уже пару дней как эккаунт между рабочим и домашним переключать в веб-интерфейсе было можно, это было официально, хотя это “реально разные эккаунты, ничего не наследуется” (в веб-интерфейсе именно так, открываешь пустой второй ChatGPT). Пришлось сделать себе skill “удачной пересадки чата” (было много неудачных вариантов, но были и удачные) в Codex App, чтобы пересадить чаты одного эккаунта в чаты другого над той же папкой проекта, но каково было удивление, когда новый эккаунт в Codex App просто подхватил старые чаты! Похоже, OpenAI сдалось – flat rate за $200 там таки появился де факто, цена токена примерно x30 меньше, чем на API “по кредитам”.

И я съел 60% недельной квоты за первые сутки после того, как стартовал этот новый эккаунт. Я просто решил, что “четыре агента в параллель на Ultra будут быстрее” – и в этом жестоко ошибался. Зато получил ещё немного опыта, сына ошибок трудных. Агента на Ultra торкало идеями примерно так же, как описывали советского инженера по сравнению с западными: он делает гениальную работу с гениальными идеями, но совсем не ту работу, что просили, и идеи его утопичны (хотя гениальны). Проявляет творчество без меры, это творчество ведёт в тупик, а если появляется MVP продукта, то его невозможно пустить в серию – там непродуманная архитектура, собрано из несовместимых каких-то кусков. Таких фальстартов на Ultra было два, по полсуток каждый. Выяснилось, что такой итог закономерен, но для этого нужно ввести пространства характеристик агентного режима работы над задачей, и там выбирать себе точки на Парето:

  • пространство характеристик качества (например, правильность, полнота, согласованность, обоснованность, устойчивость, пригодность результата для следующего хода).
  • пространство характеристик процесса получения результата (например, наблюдаемость — можно ли понять, что происходит; управляемость — можно ли изменить траекторию работы; прослеживаемость — можно ли восстановить, откуда взялось решение; предсказуемость — можно ли заранее оценить ход, стоимость и результат; воспроизводимость — насколько похожи повторные прогоны; прерываемость — можно ли остановить неверную ветвь до того, как она потратит половину квоты).
  • пространство характеристик ресурсов (например, токены, вычисления и энергия, календарное время, внимание пользователя) и эффективности (все они, поделённые на единицу результата – и вот эта “единица результата” как раз “замер в попугаях”, причём более чем резиновых).
  • ещё можно выделить пространство характеристик рисков (например, вероятность грубой ошибки, дисперсия качества – и всё это отнесённое к тяжести последствий, стоимости реализации риска).

Эти характеристики нужно ещё как-то раскрывать и понимать, чтобы в них ориентироваться. Скажем, согласованность – это про удержание общего инварианта, одной архитектурной картины, длинной последовательности причин и следствий, скрытых зависимостями между отдельными решениями, одного стиля изложения результата. Скорее всего, в просто “согласованности” схлопнуты ещё шкалы: семантическая непротиворечивость (разные части не утверждают несовместимое), архитектурная цельность (решения подчиняются одной системе границ, интерфейсов и инвариантов), причинная и процессная связность (последующие решения учитывают последствия предыдущих), стилистическая однородность (терминология и способ изложения не скачут). В характеристиках, как всегда, вкусовщина: что вам надо, то и замеряйте. Можно ли человеку понять, что происходит и вовремя вмешаться – это характеристики наблюдаемости и управляемости. Например, если агентов много, то “вассал моего вассала – не мой вассал”, вы не можете проследить и понять, что там происходило – “чёрный ящик”, хотя сейчас тот же Codex App даёт вам чат с каждым агентом, но чтобы разобраться, надо ещё догадаться в этот чат заглянуть и понять, что там этот агент делает, а задание-то давали агенту не вы, поэтому управляемость в разы и разы меньше. С числом токенов – тоже не всё просто, ибо одни модели решают задачи за мало токенов, другие – за много токенов. Вычисления – если вы хостите сами модель, вам это важно, а если нет – неважно, но зато у вас будет какая-то латентность, скорость вывода этих токенов в секунду, то есть тоже важно. Главное, что этих характеристик много, если хотите стать экспертом по AI-native разработке, то придётся разбираться.

Конкретные конфигурации агентной работы на заданном классе задач дают распределения результатов (их оценивают по многим запускам, если задач много, но у меня не распределения, а анекдотические свидетельства – никаких ресурсов для получения “распределений”), которые можно сравнивать по Парето. Max, Ultra и Pro задают семейства таких конфигураций, внутри которых могут быть как эффективные, так и заведомо доминируемые варианты – и они зависят не столько даже от них, сколько от самих задач. Например, Ultra на хорошо разделимой поисковой задаче может оказаться на границе Парето, ибо будет искать в четыре независимых потока и найдёт в четыре раза быстрее, а тот же Ultra при параллельном редактировании тесно связанных модулей — глубоко внутри доминируемой области, ибо “эй, на барже, вам муханничка не нужно? Не нужно, ну и правильно, а то б я вам намуханничал!”:

  • Ultra – это Max-режим, где просто по умолчанию приоритет распараллеливания. Там, где режиму Max почудилось, что можно распараллеливать, будет распараллелено (по умолчанию на 4 агента, но в реальности это число будет и меньше, и больше). Поэтому есть возможность сократить время получения результата, но не такая уж гарантированная: ибо есть же Amdahl, и планирование-координация-сведение результатов съедает значительную часть выигрыша, а токенов при этом кушается много. Откуда “творчество”? Два источника: умный Max вносит ранние ошибки на этапе планирования, дальше агенты исполняют неточные планы – это раз, но два – документация прямо говорит, что подагентские потоки выносят шум из основного контекста и возвращают корню резюме или «дистиллированные» результаты вместо полного промежуточного материала. Это экономит главный контекст, но создаёт информационное бутылочное горлышко, например, вместо текста доказательства теоремы вы получите идею доказательства “в общем и целом” (и что там ещё покурочит принимающий эту идею главный агент при синтезе – это тоже вопрос). Поэтому режим Ultra хорош только тогда, когда реально нужно что-то распараллелить и оно там хорошо распараллеливается и ещё как-то решена проблема передачи точного результата. Известный результат из computer science: прогресс в увеличении числа ядер ничего не даёт для ускорения сложных последовательных алгоритмов.
  • если надо выполнить длинную цепочку, то это режим Max. Агенты ему тоже доступны, но нет умолчания “срочно прекрати стратегировать, грузи агентов”, но ещё и можно эффективно вручную ему сказать, каких агентов и как использовать – результат при этом для моих архитектурных задач в разы и разы лучше, чем на Ultra. Но это “ручная коробка передач”, а на Ultra – автоматическая. Мы знаем, к чему это приводит: на первых версиях профи работают на ручной передаче, любители – на автоматической, а через некоторое время перестают выпускать версии с ручной передачей. В любом случае, для моих задач лучше Max, когда надо продумать и выполнить большой план, достичь цели через множество шагов.
  • но есть ещё режим Pro, недоступный в Codex App. Это когда надо очень глубоко продумать какую-то мысль, не проделывая цепочку шагов в каком-то “процессе”, а “собрать много чего в кучку и согласовать”, какой-то синтез – но это не точно, ибо что именно делает Pro и как оно там устроено, неизвестно. “Используйте для самых сложных задач для повышения надёжности результата” (но при этом не в Codex App), но у меня есть гипотеза (глядючи на рассуждения этого Pro): там решается задача, затем тебе пишут Finalizing, и это Finalizing занимает примерно столько же времени, сколько решение задачи. Не удивлюсь, если Pro просто тот же Max, для которого берут независимого reviewer – и дальше заставляют при этом finalizing почистить результат. Выглядит для меня ровно вот так. Мой LPF тем самым делает Pro из Max (да, тоже работает не спеша). Но даже если верна гипотеза, то Pro и LPF — не две реализации одного и того же. Pro предлагает непрозрачное для меня усиление harness, а LPF — внешнюю, наблюдаемую и локально ремонтируемую архитектуру проверки, я там могу что-то кастомизировать. То есть потенциально качество рассуждений с LPF может быть выше, чем с Pro – да ещё и в среде Codex App, а не в отдельном чате “на выселках” в вебе.

В проекте FPF удалось за неделю серьёзно сдвинуться:

  • закончена кампания R3, которая исправляет фразы, подразумевающие какую-то агентность у паттернов – все эти governed patterns. Всё опубликовано.
  • закончена первая из двух кампаний по правке паттернов, определяющих экосистему FPF, DPF, LPF, и это тоже опубликовано. Это как раз к пятому семинару: экосистема FPF там как раз важная тема. И начата вторая кампания, тоже на эту тему.
  • переделан в очередной раз LPF (и даже переделан два раза), там ещё раз разобрано – что должно быть в FPF, что в каком-то DPF (оказалось, что “пока ничего, расслабьтесь”), что и впрямь в LPF. По итогам разборки были lessons learned в кампанию по правке описания экосистемы FPF из предыдущего пункта.
  • но главное – пошёл эксперимент по созданию набора DPF, отражающего содержание руководств R5-R10. И эта работа в разгаре, она уже породила много интересного, например, спроектирован паттерн с методом концептуального синтеза “по руководствам и литературе”, отсылающим к паттернам части F, которые когда-то ровно для этого и были придуманы, “чтобы FPF писал себя сам”, наряду с паттернами части G. Тут все эти фальстарты и были, а ещё было много lessons learned для предыдущих пунктов с правками в FPF и LPF. И ещё этих lessons learned будет более чем предостаточно.

Пишу очень много, но в закрытые чаты семинаров. Там всё меня радует: люди пишут, как работа с FPF меняет их следующий ход. Вот это очень важно: у нас разбирался всё время в руководствах и в разборах с наставниками текущий ход, а FPF заставляет обязательно спросить про то, какой ход ожидается следующим: склеивает получение результата со стратегированием. Если не склеивается, то результата у вас нет – это морок, а не результат, “кажимость результата”, доделывайте или вообще бросайте и делайте что-то другое. Отчёт получается не столько о “достигнутых результатах”, сколько об “открывающихся возможностях” – вообще другой жанр! Это прямо-таки тектонический сдвиг, очень важное отличие от всего того, что мы делали. Да, конечно, про “что там дальше” у нас много всего, но посмотрите на разницу: я могу как в case management – что-то сделал, дальше оформить в папочку “результаты”, когда-нибудь из них сделать “community template” в порядке process mining. А могу наоборот – в режиме проблематизации: смотреть не на прошлое, а на будущее, какие ходы будут открыты, первый вопрос не “что получил”, а “для чего это всё делаем, что становится возможным”. Я ещё плохо могу объяснить разницу в такой сдвижке внимания, но она фундаментальна и очень существенна. В FPF это встроено, это его пронизывает сверху донизу, это даёт возможность длинных акаузальных развёрток, там всё на “показательных развёртках”, мантрах. Я начинал год назад тему “мантр”, провёл даже один семинар (сильно недооценённый, на нём было относительно мало людей), и вот теперь эта тема развёрнута, и она меняет вообще всё изложение.

Что дальше? Завтра семинар. Поэтому:

  • что успеваю из FPF и LPF, то и доделываю.
  • пример DPF пока – только DPF нарративистики, примеров DPF по руководствам не будет. Но посмотрим, что там успеется со списками идей из руководств, ибо если не сами паттерны пишутся, то хотя бы черновики DRR. Это будет пример работы с “предметными областями” и получающимися архитектурами DPF.
  • на основании нового FPF с новой архитектурой экосистемы FPF правлю тексты слайдов семинара (там 144 слайда в слайдоменте, но они прямо на сейчас ещё по старой версии FPF и LPF)
  • перегоняю в колоду слайдов (это всегда неожиданно долго)
  • генерирую картинки, уж сколько успею
  • участникам семинара даю свой LPF (но пока не пакетирую его как plugin, то есть без специфической Codex-обвязки хелперами и их skills). Открыто публиковать LPF пока не буду, но участники всей серии (а там практически 100% прошли уже 4 семинара и записались на пятый, 92 человека) оказались в ситуации не столько “лекционного семинара” или даже “семинара-практикума”, сколько в ситуации по факту резидентуры со мной как наставником – и этот бонус будет для них приятным дополнением к остальным материалам (видео, слайдомент, транскрипт, нарратив, сам FPF и пример DPF – и вот ещё пример LPF).
  • дальше несколько часов потрачу на ответы на вопросы в чате семинара, как обычно.
  • и дальше уже можно обсуждать, что там из моих мероприятий делать следующим. Планы есть, и мы на лабораториях и методсоветах их активно обсуждаем. Это планы мероприятий по работе с сообществом инженеров-менеджеров и их AI-сотрудников, а не планы развития FPF и DPFs. FPF и DPFs просто открывают следующие возможные рабочие ходы.

Разобрался с зависаниями моего компьютера: почему-то punto switcher (пользуюсь им десятки лет!) вдруг начал интерферировать с общим размером памяти, когда он управляет буфером. Любая операция cut/paste начинает вдруг приводить к свопу в виртуальной памяти – и при этом своп идёт не у самого Punto, а у задачи, куда он подсовывает свой dll, а это Codex App, Mozilla и прочее большое. Лечится это а) переходом на другой комп, где не надо распутывать, что там такого случилось, и б) переходом на другой комп, где 64Gb памяти, где не надо уходить в своп виртуальной памяти вообще, по любой причине – если задача распухла, то это ещё не повод прекращать работу. Я не хочу переезжать на свой ExpertBook до понедельника, ибо в воскресенье у меня семинар, а коней на переправе не меняют. Потом буду делать переезд “как всегда”, то есть покупкой PCmover Professional, “The ONLY software that moves your applications, files, and settings”, $69.95 – PCmover Professional – Effortless PC Migration. В прошлый раз я ровно с ним и переезжал, и это сильно лучше, чем “как обычно”, даже если считать, что в чём-то будет помогать тот же Codex App.

blog8_08_26

6 лайков