Перейти к содержанию

Разведка: рынок методологий AI-native по пяти зонам

Этап 1 проекта О проекте. Собрано 02.09.2026 по рамке Рамка разведки: пять зон, семь одинаковых вопросов к каждому подходу, шкала зрелости идея / пилоты / промышленная практика с обязательным указанием основания.

Собрано пятью зонными черновиками плюс отдельный заход внешней модели (Codex, gpt-5.6-sol) по зонам 2–5 — её вклад разобран в разделе «Что добавил второй движок». Черновики со всеми карточками — в drafts/.

Уже в базе, повторно не приношу. Плейбук Anthropic «The AI-Native SDLC» (Louis Claxton, 21.08.2026) разобран 27.08 → плейбук Anthropic: петля intent.mdspec.mdplan.md → PR → инцидент, «скилл — совет, хук — закон», ярусы автономии по сигмам, откат как самый отрепетированный путь. Он находкой разведки не считается и служит здесь точкой отсчёта, с которой сверяются остальные.


Итог одним экраном

  1. Гипотеза «деливери далеко впереди» верна наполовину. Дорога от намерения до дифа описана шестью независимыми командами, сошедшимися на одной конструкции. Дальше дифа процесс кончается: пропускная способность ревью, релиз и откат при агентном авторстве не описаны нигде.
  2. Дискавери не пуст — он густо заселён и почти не проверен. Две библиотеки агентных скиллов продакта на 33 тысячи звёзд суммарно, и ни в одной ни одного кейса с числом результата.
  3. Обслуживание — единственная зона со зрелым сводом, и тот написан Google про Google. Независимый замер отрезвляет: лучшие модели закрывают 11,4% реальных SRE-сценариев.
  4. Оперирование — самая пустая зона. Инструментов изобилие, методология ровно одна. Причина названа самим автором: тихий отказ, когда неверная сводка выглядит как верная, и обратной связи нет вовсе.
  5. Управление процессом за полгода обрело имя — harness engineering — и сразу же обзавелось эмпирикой, которая бьёт по его же предпосылке: контекстные файлы в общем случае не повышают долю решённых задач и поднимают стоимость на 20%+.

Сквозной вывод, который дороже любой отдельной находки: ни один из найденных подходов не переходит границу своей зоны. Пять зон — это пять несвязанных разговоров, ведущихся разными людьми в разных изданиях. Единственные два найденных шва между зонами — claude-code-discover, кладущий дискавери-артефакты туда, где их прочитает кодирующий агент (шов 2↔1, репозиторий на десять звёзд), и пайплайн Магнита, растящий гипотезы из базы прошлых экспериментов с оценённым эффектом (шов 2↔4, одна команда).


Зона 1 — Деливери

Зрелость: неравномерная. Путь «намерение → диф» — промышленная практика (шесть независимых команд сошлись на одной конструкции; разделение обязанностей доведено до нормы аудита в стандарте OWASP AISVS 1.0, релиз 24.06.2026). Всё после дифа — идея. Основание оценки: наличие независимого отраслевого стандарта с проверяемыми требованиями против полного отсутствия текстов с ролями по правой половине.

Подход Кто держит Источник, дата Зрелость (основание) Привязка к вендору
Таксономия SDD: spec-first / spec-anchored / spec-as-source Биргитта Бёкелер, Thoughtworks martinfowler.com, 15.10.2025 понятийная рамка (классифицирует чужое, ролей не задаёт) нет
GitHub Spec Kit GitHub, Ден Делимарский github.blog, 02.09.2025 промышленная по распространению (130K+ звёзд, v1.0), пилоты по доказанному эффекту (независимых замеров нет) нет — 30+ агентов, процесс это markdown
AI-DLC AWS, Raja SP aws.amazon.com, 31.07.2025 идея (в анонсе ни одного кейса с числами) процесс нет, обвязка тянет Amazon Q и Kiro
RPI — Research → Plan → Implement Борис Тане, Cloudflare boristane.com, 10.02.2026 пилоты (девять месяцев личной практики, сошлось с линиями Block и HumanLayer) практика нет, изложение на Claude Code
Superpowers Джесси Винсент blog.fsck.com, 18.12.2025 пилоты (~280K звёзд у плагина; воспроизводимых внедрений с числами не нашлось) да — механика Claude Code в несущей конструкции
BMAD-METHOD BMad Code github.com/bmad-code-org, репозиторий создан 13.04.2025 пилоты (воспроизводимых внедрений с числами не нашлось) частично
OWASP AISVS, Приложение C OWASP github.com/OWASP/AISVS, 1.0 — 24.06.2026 промышленная в статусе стандарта (191 проверяемое требование в двенадцати главах плюс 68 в Приложении C — проверяемые пункты аудита, а не советы) нет по определению
spec-review Александр Кальницкий, Mindbox habr.com, 20.08.2026 пилоты, близко к практике одной компании (11k кода + 18k тестов в проде без инцидентов, 30k RPS) нет

Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакт — цепочка markdown в репозитории: конституция проекта, спека, план, задачи (Spec Kit); research.md и plan.md, переживающие сжатие контекста (RPI); requirements.md в нотации EARS, design.md, tasks.md плюс steering-файлы со стандартами команды (Kiro — инструментальное воплощение AI-DLC); спека из восьми разделов, приёмочные тесты на Gherkin, журнал архитектурных решений (Mindbox). Человек утверждает конституцию и спеку, отвечает на вопросы шага уточнения и принимает результат; точка «человек сказал да» стоит на переходе от спеки к плану. Агенту отданы план, декомпозиция, реализация, кросс-артефактная сверка спеки с планом и задачами на противоречия — работа, которую раньше делал аналитик, — и ревью собственной работы чужими глазами: субагент-ревьюер стартует с чистым контекстом и потому не защищает код, который сам написал.

Что устоялось. Между «хочу» и «пишу код» вставляется утверждаемый человеком письменный артефакт, живущий в репозитории, а не в чате, — к этому пришли шесть команд, стартовавших с разных сторон. Разделение обязанностей формулируется на трёх уровнях сразу: как норма аудита (AISVS AC.8.1: агент не может одобрить, смёржить или задеплоить то, что сам породил, и ограничение обеспечивается системой контроля версий, а не политикой), как реализованная механика (Superpowers 4: spec-review и code-review — разные агенты, code-review берётся за качество кода только после того, как spec-review подписал соответствие плану), как архитектурный принцип (плейбук Anthropic).

Чего нет даже здесь. Пропускной способности пути «одобрено → в main»: команды с высокой долей ИИ мёржат почти вдвое больше PR, а метрики поставки не двигаются, потому что очередь на мёрж рассчитана на человеческую скорость (Tian Pan, 02.07.2026 — очередь с получасовым CI пропускает 48 PR в сутки). Ревью в масштабе: все подходы исходят из того, что находок столько, сколько человек прочитает. Релиза и отката при агентном авторстве: есть приёмы инфраструктуры, нет ролей.

Отрезвляющий замер. DORA 2025 (около 5000 респондентов, 90% используют ИИ): внедрение ИИ отрицательно связано со стабильностью поставки; ИИ работает усилителем существующих сильных и слабых сторон организации. Ни одна из найденных методологий не показывает, что её применение это снимает.


Зона 2 — Дискавери

Зрелость: пилоты. Основание: процессов описано много, прогонов почти нет — ни одна из четырёх найденных библиотек и конвейеров не приводит внедрения или числа результата; единственная крепкая эмпирика зоны отрицательная (сводка 12 рецензируемых работ по синтетическим пользователям) плюс одна количественная валидация в узком классе задач.

Подход Кто держит Источник, дата Зрелость (основание) Привязка к вендору
Двухшаговый синтез интервью → дерево возможностей Тереза Торрес / Vistaly producttalk.org, 18.02.2026 пилоты (альфа с набором по заявкам, партнёры без имён и чисел) метод нет, реализация — Vistaly
Где AI помогает и где вредит в анализе интервью Тереза Торрес producttalk.org, 08.10.2025 идея с личной проверкой (~30% прямых цитат от ChatGPT неверны — её собственный прогон) нет
Недельный цикл дискавери в эпоху AI Albers Advisory albersadvisory.biz, 16.07.2026 идея (авторы прямо признают: цикл целиком не прогоняли) нет
pm-skills — 68 скиллов и 42 связанных workflow в девяти плагинах Paweł Huryn github.com/phuryn/pm-skills, создан 01.03.2026 пилоты (25 919 звёзд — мера внимания; кейсов и чисел результата нет) частично: markdown переносим, команды / от Claude
Product-Manager-Skills — 77 скиллов Dean Peters github.com/deanpeters, создан 05.02.2026 пилоты (6 787 звёзд, кейсов нет) нет — автор сознательно отказался от шаблонов Claude ради переносимости
claude-code-discover — дискавери-артефакты в репозитории кода shinpr github.com/shinpr, создан 23.03.2026 идея (10 звёзд, ни одного числа) да — плагин-маркетплейс Claude Code
Semantic Similarity Rating — синтетика с валидацией PyMC Labs + Colgate-Palmolive arXiv 2510.08338, 09.10.2025 промышленная в узком классе (57 корпоративных опросов, 9 300 человеческих ответов, 90% от тест-ретест надёжности человека, две модели разных вендоров) нет — проверено на GPT-4o и Gemini
Контр-позиция: синтетика не заменяет исследование NN/g + MeasuringU nngroup.com, 21.06.2024 · measuringu.com, 14.04.2026 промышленная как критерий приёмки (сводка 12 рецензируемых работ: 9 обнадёживающих против 14 разочаровывающих, по качественной глубине 0 из 3) нет
UXAgent — симулированные пользователи как пилот перед людьми Lu, Yao et al. arXiv 2502.12561, 18.02.2025, CHI 2025 идея с прототипом (оценка на пяти UX-исследователях) нет
Мульти-агентный тематический анализ несколько академических групп arXiv 2509.17167, 21.09.2025, и соседние работы пилоты (несколько независимых рецензируемых прогонов на реальных корпусах; совпадение с ручным анализом ограничено) нет, часть работ специально на открытых моделях
CollabCoder — совместное индуктивное кодирование Jie Gao et al., SUTD / Notre Dame CHI 2024, 11.05.2024 пилоты (лабораторная оценка, 16 участников) нет — трёхфазный процесс не зависит от функции OpenAI
LLM-in-the-loop Thematic Analysis Dai, Xiong, Ku Findings of EMNLP, 12.2023 пилоты (два кейса, качество сопоставимо с человеческим кодированием) протокол переносим, оценка только на GPT-3.5
Interview-Informed Generative Agents Zichao Wang, Alexa Siu arXiv 2603.29890, 10.03.2026, CHI 2026 пилоты (одно продольное исследование, N=51, 3 060 человеческих и столько же синтетических ответов) архитектура переносима, доказательство на компонентах OpenAI
Пайплайн генерации гипотез из истории экспериментов Иван Одинцов, Магнит habr.com, 25.08.2026 пилоты (одна команда с числами воронки: ~100 карточек → ~200 гипотез → ~50 после авто-ревью → 15 в бэклог) нет — модель пайплайна в статье не названа
Continuous discovery на AI-модерируемых интервью Perspective AI и соседи getperspective.ai, 08.06.2026 идея, поданная как практика («300 команд» без методики и выборки) да — интервью ведёт их агент, данные у них
Прототип-первый дискавери в самой лаборатории Cat Wu, Anthropic claude.com, 19.03.2026 пилоты (практика одной команды, внешние голоса из Decagon и Datadog) ход «прототип вместо PRD» переносим

Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты называют по-разному, но перечень сходится: снимок интервью (карта опыта, ключевые моменты, возможности, цитаты, факты), дерево возможностей, привязанное к исходу, карта допущений по четырёхрисковой модели, критерии отказа, записанные до прототипа, и — редкий случай — дискавери-документы, лежащие прямо в дереве проекта (docs/product/, docs/discovery/, docs/prd/), чтобы их прочитал кодирующий агент. У Магнита артефакт другой природы: база карточек прошлых экспериментов с оценённым бизнес-эффектом, из которой и растут гипотезы.

Роли разграничены тремя разными людьми и тремя разными фразами, рамки из этого не складывается: у Торрес агенту отдан нотетейкинг, синтез остаётся человеку; у BuildBetter (blog.buildbetter.ai, 28.08.2026 — конвейер из восьми скиллов кастомер-дискавери) интервью остаются человеческой работой, агент обслуживает планирование и приоритизацию вокруг них; у Albers агент обрамляет разбор — готовит материал до обсуждения и фиксирует после, — а само обсуждение ведут люди. Агенту в сумме отданы транскрибация, кодирование и тегирование, извлечение возможностей из одного интервью, генерация гипотез и их первичный отсев, дизайн эксперимента. Никто не описал, что происходит, когда агент ошибся.

Где сгущение. В двух точках, и обе смещены от собственно открытия. Синтез интервью: есть метод, есть его отрицание тем же автором, есть академическая проверка с честным «совпадение с ручным анализом ограничено». Синтетические респонденты: рынок за год развёлся надвое — количественный концепт-тест получил валидацию, качественная глубина получила вердикт 0 из 3.

Русскоязычный контур. Отстаёт не по инструментам, а по жанру: там, где на английском пишут процесс, по-русски пишут про респондента. Рынок синтетики измерен — около 0,12 млрд руб. в 2024 при общем рынке исследований 23,4 млрд (Эдгар Отченашенко, 21.11.2025), игроков не меньше шести, есть отраслевой опрос («Анкетолог», 10.08.2026: 68% уверены, что синтетика никогда не заменит живых полностью) и академический разбор границ применимости (Жуликов, «Интеракция», 03.07.2026). Описанного процесса дискавери с агентами — ни одного, кроме пайплайна Магнита.


Зона 3 — Обслуживание

Зрелость: пилоты с одним островом внутренней промышленной практики. Основание — три независимых свидетельства: ITBench (ICML 2025) — лучшие модели решают 11,4% реальных SRE-сценариев; SRE Report 2026 (Catchpoint/LogicMonitor, 418 практиков) — медианный toil 34%, около половины респондентов не видят от ИИ снижения рутины; и сами вендоры (Microsoft, Datadog, Rootly) рекомендуют начинать с режима чтения.

Подход Кто держит Источник, дата Зрелость (основание) Привязка к вендору
SRE AI: ярусы L0–L4 и «Safety Trifecta» Google SRE cloud.google.com, 28.05.2026 · белая книга пилоты, переходящие во внутреннюю практику одной компании (перечислены работающие системы с именами; публичных чисел по доле автономных закрытий нет) несущая конструкция нет, реализация — Gemini, Vertex, ADK
Azure SRE Agent: incident response plan, режимы Review / Autonomous Microsoft learn.microsoft.com, 08.06.2026 практика внутри одной компании (самоотчёт к GA: 35 000+ смягчённых инцидентов, 20 000+ сэкономленных часов в месяц; независимой проверки нет) да — план описан в терминах ресурсов Azure
Investigations как самостоятельный артефакт incident.io incident.io, 02.07.2025 пилоты (ни один клиент не назван; «до 80% сокращения MTTR» без методики) процесс переносим, реализация на их платформе и Slack
Bits Investigation: цикл гипотез + методика оценки агента Datadog, Shan и Ratchford datadoghq.com, 12.01.2026 пилоты (детальная инженерия и эвал-контур; «до 95%» — вендорское заявление) методика оценки переносима полностью, агент привязан к их телеметрии
Модель зрелости AI SRE L0–L3 и 90-дневный переход Rootly, Purvai Nanda rootly.com, обновлено 03.08.2026 идея, оформленная как методика (внятная процедура, ни одного названного внедрения) нет
Agentic Incident Management Guide L1–L3 ilert ilert.com — даты публикации на странице нет (строка «Published» вшивается при сборке сайта: живая страница отдаёт одно значение, архивная копия от 07.12.2025 — другое, отстающее от даты обхода на двое суток); опубликована не позже 07.12.2025 по первому снимку web.archive.org идея (ни внедрений, ни чисел) нет
Уровни автономии агента L0–L5 Cloud Security Alliance, Jim Reavis cloudsecurityalliance.org, 28.01.2026 идея (консорциумный документ без внедрений) нет — вендор-нейтральный источник
AIOpsLab / парадигма AgentOps Microsoft Research + Berkeley, UIUC, IISc arXiv 2501.06706, 12.01.2025 промышленная в нише оценки (открытый код, многоинституциональное авторство, стандарт сравнения) нет
ITBench — 102 сценария SRE / CISO / FinOps IBM Research PMLR v267, ICML 2025 — сборник трудов конференции, дня публикации у тома нет промышленная в нише оценки (рецензированная площадка, открытый код) нет
Tool-using ReAct agent для RCA Microsoft Research, Devjeet Roy et al. FSE, 07.2024 пилоты (оценка на отложенном наборе реальных инцидентов Microsoft; автономное исправление не исследовалось) паттерн переносим, доказательство на закрытых данных
AI-assisted root-cause isolation Meta Engineering engineering.fb.com, 24.06.2024 пилоты (внутреннее применение с бэктестом: истинный виновник в top-5 в 42% расследований) да — fine-tuned Llama 2, внутренний граф кода, ~5 000 примеров
LLM-assisted постмортемы Datadog, Le, Pieper, McGarvey datadoghq.com, 23.09.2024 пилоты (доведено до продукта, >100 часов на настройку структуры; независимых внедрений нет) принцип «черновик, не автор вывода» переносим

Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты зоны конкретнее, чем где-либо: runbook, который агент правит по факту использования в инциденте и порождает новые из закрытых инцидентов; расследование как самостоятельная сущность с findings и гипотезами; «context packet» — сводка с ранжированными гипотезами, где каждая проверяема и снабжена ссылкой на доказательство; incident response plan как именованная запись «фильтр инцидента → какой агент → какой уровень автономии»; черновик постмортема; handoff-документ при передаче дежурства.

Человек — дежурный и архитектор рамок; формулировка свода Google прямая: экспертиза смещается в задание жёстких границ системы, а не в ручное вмешательство. Агенты разведены по функциям — обнаружение аномалий, обработка алертов, расследование, оркестрация инцидента, постмортем, коммуникация. Что именно отдано агенту, определяется ярусом: только чтение и сбор контекста → диагностика без права менять → действие после одобрения плана → самостоятельное закрытие узкого класса инцидентов с внятным сигналом успеха и только обратимыми действиями.

Что устоялось и годится к переносу. Ярусы автономии как обязательный элемент разговора — к этому независимо пришли пятеро (Google L0–L4, CSA L0–L5, Rootly L0–L3, ilert L1–L3, Azure Review/Autonomous). Ключевая деталь из документации Azure: уровень автономии привязывается к классу инцидента, а не к агенту целиком. Условие входа в автономию жёстче всех сформулировано у Rootly: только обратимые действия. Google формулирует ограничение инструментов сильнее всех: любая система обязана поддерживать dry_run=true, а инструмент, которым пользуется агент, обязан быть неспособен уронить прод в одиночку, кем бы он ни вызывался.

Самое переносимое, что произвела зона — регресс-эвал агента на исторических инцидентах. Две независимых реализации (Google: ночные прогоны с LLM-судьёй и разметкой Bronze/Silver/Gold; Datadog: размеченные реальные инциденты с архивной телеметрией) и два открытых бенчмарка.

Чего нет. Независимого свода, написанного не продавцом. Обновления канона Google SRE под агентов — классическую книгу под агентов никто не переписал. Ответственности за автономное действие: ближайшее найденное — диалог «Autonomous mode acknowledgment» в Azure, где Microsoft перекладывает ответственность за область прав на заказчика.


Зона 4 — Оперирование

Зрелость: идея с одним пилотом промышленного качества. Основание: по признаку рамки полностью проходит ровно один текст. Инструментов при этом изобилие — Cube, ThoughtSpot, Amplitude, Databricks, dbt, Mixpanel выпустили агентов над своими данными, Gartner завёл под это категорию. Нет описанного порядка, в котором человек и агент вместе превращают цифры в решение.

Подход Кто держит Источник, дата Зрелость (основание) Привязка к вендору
Четырёхслойный стек самообслуживаемой аналитики дата-команда Anthropic claude.com, 03.06.2026 пилоты (работающий процесс одной компании с числами и признанием провалов; независимых воспроизведений нет) четыре слоя переносимы, иллюстрация на Claude
Open Semantic Interchange v0.1 → Apache Ossie консорциум (Snowflake, Salesforce/Tableau, dbt Labs) snowflake.com, спека v0.1 — 27.01.2026; передача в Apache Incubator — 10.07.2026, ossie.apache.org пилоты на пути к промышленной (опубликованная спека, управляющий орган в лице фонда, поддержка в независимых реализациях) нет — над ним фонд, а не компания
Market Guide for Agentic Analytics Gartner gartner.com, редакция 2026; точной даты публикации в открытом доступе нет, документ платный идея / рамка рынка (карта категории для закупщика) нет; читалось по вторичным цитатам, текст платный
Decision Governance Gartner пресс-релиз, 11.03.2026 (домен закрыт для автоматических запросов, 403) идея (ни одного описанного внедрения) нет
InsightBench + AgentPoirot ServiceNow Research arXiv 2407.06423, подано 08.07.2024, принято на ICLR 2025 промышленная в нише оценки (открытые код и данные, воспроизводимость) нет — судья открытая модель
Цикл Ingest → Analyze → Explain → Recommend → Act Databricks databricks.com, 2026 — дата на странице не проставлена идея (ни одного названного внедрения) петля переносима, текст объясняет их платформу
Разделение труда между агентами над семантическим слоем Cube cube.dev, 2026 — дата на странице не проставлена идея / ранние пилоты мысль «агент выбирает из сертифицированных определений» переносима, остальное про Cube Cloud
Две фазы: insights и actions Amplitude amplitude.com, 2026 — дата на странице не проставлена идея / ранние пилоты (ни одного клиента, ни одного числа) да — понимание их таксономии событий объявлено преимуществом
Агентная аналитика как диагностика организации Thomas in 't Veld, Tasman tasman.ai, 05.01.2026 идея (ни чисел, ни примеров реализации) нет
InsightPilot — intent-driven exploratory analytics Microsoft Research + HKUST EMNLP, 12.2023 пилоты (четыре дата-сайентиста, два датасета, 24 сравнения) разделение вычисления и интерпретации переносимо; модель в статье не названа
Finch — финансовый дата-агент Uber FinTech uber.com, 17.07.2025 пилоты (используется финансовыми командами; охват не опубликован; валидация критических запросов руководства — ещё roadmap) модели заменяемы через их шлюз, практика завязана на Slack, LangGraph, внутренние витрины
Внутренний дата-агент с повторяемыми workflow OpenAI openai.com, 29.01.2026 (домен закрыт для автоматических запросов, 403; в браузере открывается) пилоты (реальное использование в пяти функциях; доля пользователей и бизнес-эффект не раскрыты) да — GPT-5.2, Codex, их эвалы и источники
Двухуровневый гипотезный разбор project44, Chauhan и Sood project44.com, 06.04.2026 пилоты (сравнение с одним ручным разбором: все прежние факторы найдены, время ~в 16 раз меньше; 80–85% совпадения ключевых выводов на трёх запусках) гипотезный процесс переносим, данные их

Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты: канонические датасеты и метаданные как продукт; семантический слой с метриками и разрезами плюс граф зависимостей; процедурное знание в markdown двух видов — knowledge skill, сужающий пространство поиска, и runbook skill, кодирующий рабочий ход старшего аналитика; эвал-набор с эталонными ответами. У остальных — журналы решений и следы аудита, панели наблюдения за поведением агента.

Роли разграничены жёстче, чем в любой другой зоне, и во всех источниках одинаково: определения метрик пишет и версионирует человек, агент из них выбирает. За человеком также ведение справочной документации, эталонные ответы для эвалов, ревью содержания skills по доменам и качество данных. Агенту отдано сопоставление вопроса сущностям модели, обращение к семантическому слою, генерация и исполнение SQL, обнаружение аномалий, объяснение и выработка рекомендации — у Anthropic это 95% запросов бизнес-аналитики. Чего никто не отдал агенту и не оставил явно человеку — подпись под решением, принятым по сводке.

Единственная полная методология зоны — четыре слоя Anthropic, и она сама сообщает, где дырява. Data Foundations → Sources of Truth (семантический слой, цель «одно число»: метрика разрешается одинаково в дашборде, в ноутбуке и в разговоре с агентом) → Skills (процедурное знание в markdown; knowledge skill сужает поиск примерно до 30 курируемых файлов, runbook skill кодирует ход старшего аналитика) → Validation (офлайн-эвалы, абляционные тесты, онлайн-мониторинг). За человеком оставлено прямо перечисленное: определения метрик курируются руками и не генерируются автоматически, ведение справочной документации, эталонные ответы для эвалов, ревью содержания skills.

Два измеренных факта оттуда, экономящих чужой год: без структурированных skills точность упирается в 21%, с ними — устойчиво выше 95%; а наваливание агенту всего исторического корпуса запросов сдвинуло точность меньше чем на процентный пункт — узкое место не в объёме сведений, а в их структуре.

Три наблюдения, которые я считаю выводом, а не пересказом.

  1. Зона сместила разговор с процесса на определения. Все источники независимо упираются в семантический слой: Anthropic — «одно число», Tasman — «внутренний API-контракт между командами», OSI — общий формат, Gartner — семантическая согласованность как фактор расхождения лидеров. Отраслевой диагноз: типовой провал агентной аналитики — не галлюцинация, а семантическая ошибка (взял не ту таблицу, соединил не на том уровне детализации). Договориться о процессе нельзя, пока не договорились о метриках.
  2. Тихий отказ как причина пустоты. Anthropic называет нерешённым правдоподобный неверный ответ, расходящийся по компании без возражений. В зоне 3 ошибка агента видна — прод падает. В зоне 4 неверная сводка выглядит ровно как верная. Процесс без обратной связи в методологию не складывается — отсюда у зоны есть слои, стандарты и продукты, но нет цикла.
  3. Ответственности не назначил никто. «Человек остаётся ответственным за интерпретацию» встречается у Anthropic, Tasman, Databricks и в русском контуре — и ни у кого не превращено в процедуру: кто подписывает, что подписывает, что происходит, если сводка была ошибочна. Ближайшее — формулировка Gartner, что вопрос смещается от «кто нажал кнопку» к «какой guardrail допустил исход», и это лозунг.

Русскоязычный контур пуст по методологии. Лучшее найденное — Олег Игнатов, Garage Eight, 17.02.2026 с одной фразой про разграничение: «алгоритм может подсказать, где „что-то не так“, но понять, почему это произошло и что с этим делать — задача человека». Остальное по этим запросам — подборки «ТОП-10 BI-систем».


Зона 5 — Управление процессом

Зрелость: пилоты, с одной полосой промышленной практики и одной — промышленного измерения. Основание: распространение файлов инструкций — практика (60 000+ репозиториев с AGENTS.md, ~20 инструментов, стандарт под Linux Foundation, кольцо Adopt у Thoughtworks); измерение зоны — практика в исследовательском смысле (четыре независимые группы за полгода, выборки в тысячах репозиториев); сопровождение методологии как процесс — идея с двумя пилотами; производственной метрики качества харнеса нет вовсе.

Подход Кто держит Источник, дата Зрелость (основание) Привязка к вендору
Harness engineering: guides (feedforward) и sensors (feedback) Биргитта Бёкелер, Thoughtworks martinfowler.com, 02.04.2026 идея с примерами (названы OpenAI и Stripe; количественных данных нет) нет
Agent Harness Engineering как зонтичная дисциплина Адди Османи, O'Reilly Radar oreilly.com, 15.05.2026 пилоты (Terminal Bench 2.0: одна модель в разных харнесах даёт разное — харнес весит больше выбора модели) нет, с оговоркой про co-training
Харнес-инжиниринг с измеряемым циклом Вивек Триведи, LangChain langchain.com, 17.02.2026 пилот с числами (52,8% → 66,5% на Terminal Bench 2.0 без смены модели; внедрение одно — своё) да — цикл построен на LangSmith; авторы подчёркивают, что харнес надо подгонять под модель
Harness engineering у Codex OpenAI openai.com, 02.2026 — точный день не установлен, страница недоступна автоматическому запросу (страница отдала 403, читалось через InfoQ) пилот с крупными числами, одно внедрение (пять месяцев, ~млн строк беты, ноль строк руками, ~10×; внешнего подтверждения нет) да
Curated shared instructions + feedback flywheel Thoughtworks Technology Radar radar: инструкции — Adopt, 11.2025 · radar: маховик — Assess, 04.2026 практика в части инструкций (Adopt = применяем по умолчанию, сотни клиентских команд), идея в части маховика нет
AGENTS.md как стандарт Agentic AI Foundation, Linux Foundation agents.md — спецификация версий и дат не несёт; опубликована не позже 10.03.2025 по первому снимку web.archive.org практика по распространению (60 000+ проектов, ~20 инструментов); процесса управления и версионирования у стандарта нет нет по построению
Что в этих файлах реально лежит Galster et al. arXiv 2602.14690, подано 16.02.2026, финальная версия 30.06.2026, AIware 2026 промышленная в измерении (2 853 репозитория, пять инструментов) нет
Эмпирика против: помогают ли контекстные файлы Gloaguen et al., SRI Lab, ETH Zürich arXiv 2602.11988, 12.02.2026 промышленная в измерении (разные LLM, разные агенты, файлы и сгенерированные, и написанные людьми) нет
Конфигурационные запахи в SKILL.md Hong, Imani, Ahmed arXiv 2607.01456, 01.07.2026 промышленная в измерении (238 реальных скиллов; >99% содержат хотя бы один запах) нет
Skill Eval: pass@k против pass^k Минко Гечев blog.mgechev.com, 26.02.2026 идея с работающим инструментом (внедрений не названо) нет — Gemini, Antigravity, Claude
Пирамида тестов харнеса: hook / skill / workflow Ранджан Кумар ranjankumar.in, 15.07.2026 идея с одним рассказанным кейсом да — CLI и модели Anthropic; паттерны переносимы
Замкнутый цикл «ревью → правило» Aggarwal, Ghalaty arXiv 2607.13091, 13.07.2026 пилот с числами (35+ микросервисов, свод вырос с 5 до 18 правил, 0% повторения классов ошибок, на которые есть правило) нет — перенос правил между интерфейсами заявлен как результат
Автоэволюция харнеса без человека Lin et al., Fudan arXiv 2604.25850, 28.04.2026 идея, проверенная на бенчмарке (Terminal-Bench 2: 69,7% → 77,0% за десять итераций) нет; ⚠️ ровно то, что Thoughtworks помечает «пока не рекомендуем»
Harness-Bench: способность заявляется парой «модель+харнес» Yao et al. arXiv 2605.27922, 27.05.2026 пилоты / исследование (106 задач, 5 194 траектории) нет
Организационная память для агентов Kirchdorfer et al. arXiv 2607.03228, 03.07.2026 идея с proof-of-concept (закупочный сценарий, чисел нет) нет
Index sickness: когда правил становится слишком много Zhang, Song arXiv 2606.19121, 17.06.2026 пилот-одиночка (391 последовательная сессия; объём инструкций сокращён ~на 75%, рецидивов не было ~150 сессий) нет
Prompt governance: критика самого допущения Neumann, Sargeant, Singh arXiv 2606.07539, подано 29.04.2026, принято на ACM FAccT 2026 идея / критика с академическим весом нет
Model AI Governance Framework for Agentic AI IMDA, Сингапур imda.gov.sg, 22.01.2026, обновлён 20.05.2026 регуляторная рамка, соблюдение добровольное; первая в мире именно под агентов нет
Error-analysis-first eval loop Hamel Husain, Shreya Shankar hamel.dev, 28.05.2025, обновлено 01.09.2026 промышленная практика (метод преподан 700+ инженерам и PM, независимые продуктовые кейсы — например Nova Escola, ~1 млн пользователей в месяц, ежедневные эвалы на 2% трафика) нет — авторы рекомендуют начинать с ноутбука и эксперта, а не с платформы
EDDOps — Evaluation-Driven Development and Operations Xia, Lu, Zhu et al., CSIRO Data61 arXiv 2411.13768, актуальная версия 17.11.2025 пилоты (выведено из обзора 134 академических и 27 практических источников, инстанцировано на пред-продакшн ассистенте) нет — архитектура рассчитана на замену модели и инструментов
Production evidence → eval target → bounded agent task Thrive Holdings, OpenAI, сеть Crete openai.com, 27.05.2026 (403 для автоматических запросов) пилоты крупного масштаба (30+ бухгалтерских фирм, 7 000 деклараций; за шесть недель доля деклараций с ≥75% корректных полей выросла с 25% до 86%) схема переносима, реализация на Codex
AI-Disrupt PDLC Кирилл Меньшов, Сбер ЦИПР, 19.05.2026; v2.0 — 07.2026, ria.ru; разборы — habr.com (v1.0) и popovs.tech (v2.0) практика в части GigaCode (14 000 разработчиков, доля принятого AI-кода 45% → 69%), пилот в части самой методологии (при 175 страницах v2.0 собственных метрик внедрения в документе нет — по разбору Попова) методология переносима, реализация на GigaCode и российский регуляторный контур

Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты: файлы инструкций (AGENTS.md, CLAUDE.md, rules-файлы), уложенные в baseline-репозиторий, из которого скаффолдятся новые сервисы, — так обновление шаблона расходится по командам само; набор поведенческих правил с автоматической валидацией целостности и чеклист самопроверки, исполняемый агентом до сдачи; эвал-наборы с историей прогонов, привязанной к версии конфигурации; трейсы как основной материал наблюдения; хуки на точках жизненного цикла.

Человек здесь — «на контуре», а не внутри него: он правит харнес, наблюдая повторяющиеся сбои агента, и каждое ограничение обязано быть прослежено до конкретного сбоя, а не придумано впрок. Агент внутри контура — объект регуляции, не её субъект. Отдано агенту немногое и с оговорками: разбор собственных трейсов на ошибки, самопроверка по чеклисту перед сдачей. Крайний случай — харнес, который правит себя сам, — существует и проверен на бенчмарке, но Thoughtworks помечает его «пока не рекомендуем к общему применению»: риск разрастания контекста и шумной обратной связи, уводящей агента.

Что сложилось быстрее, чем ожидалось. Слово: «harness engineering» за полгода прошло путь от блога до вакансий в Cursor, Intel и Instabase и до статьи на сайте Фаулера; конкурирующего термина нет. Разделение вклада модели и вклада обвязки: Harness-Bench требует заявлять способность на уровне пары «модель+харнес», LangChain меряет это на себе (+13,7 п.п. без смены модели), Сбер оценивает вклад детерминированной обвязки в 98%. Разворот от «пишите больше инструкций» к «пишите меньше»: ETH Zürich — файлы не помогают и стоят 20%+; Zhang и Song — минус 75% объёма и болезнь ушла.

Главное натяжение зоны. Между «правило как способ управления» и эмпирикой, которая говорит, что правила работают не так, как предполагается. Отрасль отвечает тем же ходом, что и плейбук Anthropic: перевести обязательное в детерминированный слой, оставив тексту рекомендательную роль. У Сбера это разведено терминологически — policy enforcement против context-as-guidance; полезнейшая формулировка, привезённая разведкой.

Чего не написано и написать некому. Как ревьюят изменение свода правил, кто подписывает, что происходит при конфликте двух правил, как правило устаревает и удаляется. Ближе всех Aggarwal и Ghalaty с автоматической валидацией целостности набора — и там 18 правил на 35 сервисов. Процедуры вывода правила из обращения нет ни у кого.


Модель-агностичность: где реальна, где заявлена

Сквозное требование проекта проверялось у каждого подхода отдельно (колонка «привязка» в таблицах выше). Картина по типам.

Реально переносимо — конструкция не опирается ни на модель, ни на платформу: отраслевые стандарты и рамки (OWASP AISVS, CSA L0–L5, OSI, IMDA), академические работы и бенчмарки (AIOpsLab, ITBench, InsightBench, Harness-Bench, эмпирика ETH), методики с процедурой вместо инструмента (Rootly L0–L3, error-analysis-first evals Хусейна, EDDOps, замкнутый цикл «ревью → правило», Product-Manager-Skills — единственная библиотека, где переносимость была осознанной целью автора).

Переносим процесс, но не реализация — самая населённая категория: четыре слоя Anthropic, свод Google SRE, двухшаговый синтез Торрес, spec-review Mindbox, AI-DLC, Spec Kit, Superpowers, Tax AI, AI-Disrupt PDLC. Идея снимается с носителя, обвязка — нет.

Вендор в несущей конструкции — Azure SRE Agent (план описан в терминах ресурсов Azure), Amplitude (понимание их таксономии событий объявлено конкурентным преимуществом), Perspective AI (интервью ведёт их агент, данные у них), Meta RCA (дообученная модель плюс внутренний граф кода), claude-code-discover и пирамида тестов харнеса (требуют механики Claude Code).

Особый случай, ломающий привычное понимание агностичности. LangChain показывает измерением, что харнес нужно подгонять под модель, а не переносить: более ранняя версия их харнеса на Claude Opus 4.6 дала 59,6% — на 6,9 п.п. ниже финального результата на gpt-5.2-codex, причём тот же цикл улучшений под Claude авторы не прогоняли. Османи добавляет механизм: co-training приводит к тому, что модель переобучается под харнес, в котором её тренировали. Это значит, что «модель-агностик» в нашем случае — свойство процесса и артефактов, а не конфигурации. Артефакты, роли и переходы обязаны пережить смену модели; конкретный текст инструкций — не обязан и, судя по замерам, не переживёт.

Формулировка, которую стоит забрать в методологию дословно (Codex, раздел про маркетинг): единый API-адаптер доказывает заменяемость endpoint, но не переносимость качества, семантики промптов, поведения при работе с инструментами и безопасности. Агностичность интеграции ≠ агностичность методологии.


Белые пятна

Восемь мест, где методологии нет. По каждому — что искали и что вернулось вместо.

  1. Ответственность за решение, принятое по агентной сводке (зона 4). Искали: "agentic analytics" framework accountability who owns the decision AI insight human review process, agent generated insights human trust verification "decision log" analytics governance practice case study numbers. Вернулось: общие рамки управления агентами (CSA, IMDA, препринты про безопасность агентов) — они про агентов вообще, не про решения по цифрам. Ни одной компании, описавшей, как устроена подпись под таким решением. Самое большое пятно всей разведки.

  2. Метрика качества дискавери (зона 2). Искали: how to evaluate quality of AI-assisted discovery output evals product research rubric, discovery quality metrics. Вернулось: эвалы для LLM-продуктов вообще, рубрики для академических работ, LLM-as-a-judge как приём. Рынок научился мерить выход модели и не умеет мерить выход открытия. Ближайшее к нужному — оценка качества входа (доля «историй» против «мнений» в транскрипте) в заброшенном учебном репозитории на три звезды.

  3. Приоритизация продуктовых гипотез агентом как метод (зона 2). Искали: hypothesis prioritization with LLM product experiment backlog agentic RICE evidence. Вернулось: контент-маркетинг про RICE/ICE/Kano вообще без агентов и академические работы про приоритизацию генов. Есть промпт «оцени по RICE» и ровно один корпоративный пайплайн — Магнит.

  4. Производственная метрика качества харнеса (зона 5). Искали: measuring harness quality metrics coding agent "eval" instruction file impact benchmark study. Вернулись только исследовательские бенчмарки: измеряют исследователи для сравнения, а не команды для управления. Бёкелер называет эту дыру в апреле — к сентябрю она на месте.

  5. Внутренняя роль владельца харнеса (зона 5). Искали: "harness engineer" OR "agent experience engineer" job posting hiring team owns skills hooks rules company, "AI enablement" team role platform engineering for coding agents ownership 2026 case study. Вернулось: четыре продуктовых вакансии (Cursor, Intel, Instabase, Geniee) — все строят харнес на продажу; обзоры «профессий будущего»; вендорский список из шести ролей без указания, кто именно сопровождает харнес. Ни одного описания «в компании X за файлы правил отвечает Y, ревью проходит так-то».

  6. Процесс «одобрено → в прод» при агентной скорости (зона 1). Искали: continuous integration for AI agents merge queue progressive delivery rollback agent speed deployment safety 2026 practice. Вернулось: материалы про выкатку самих моделей — это другая тема, описанная гораздо лучше, — и одна честная инженерная статья про очередь на мёрж. Методологии с ролями нет.

  7. Выдача агенту права записи в прод как описанная процедура (зона 3). Искали (заход Codex): LLM agent on-call autonomy levels, agent production remediation approval rollback, autonomous SRE incident lifecycle. Не найдено независимого промышленного процесса: классификация действия по радиусу поражения, двойное подтверждение, срок действия полномочия, автоматическая проверка восстановления, отзыв автономии. Публичные материалы заканчиваются на разборе причины или описывают превью облачного продукта.

  8. Управление организационной памятью: чей факт, какой у него срок годности (зона 5). Искали: organizational agent memory governance, prompt instruction versioning ownership workflow, RAG as a process not architecture ownership lifecycle knowledge base curation. Вернулись обзоры архитектуры и рынок инструментов управления промптами. Кто владеет фактом, когда он устаревает, кто разрешает противоречия, как изменение контекста проходит ревью и откат — не описано. Единственное именованное решение задачи версионирования контекста — сберовский Context Supply Chain, и он описан на уровне названия.

Отдельно: чего не нашлось, потому что этого нет ни у кого. Сквозного контура между зонами. Каждая зона производит артефакты, которые не читаются соседней: дискавери не отдаёт деливери ничего именованного, обслуживание не возвращает дискавери разбор инцидента как источник гипотез, оперирование не замыкается на приоритизацию. Два найденных исключения — claude-code-discover (репозиторий на десять звёзд) и пайплайн Магнита (одна команда, публикация на Habr) — вес имеют не по зрелости, а по тому, что кроме них швов нет.


Что добавил второй движок

Codex (gpt-5.6-sol) заходил отдельно по зонам 2–5 с тем же файлом рамки и без доступа к результатам зонных сборщиков. Полный ответ — drafts/codex-otvet.md.

Взял.

  • Тринадцать подходов, которых не было ни в одном из зонных черновиков и которые вошли в таблицы выше: CollabCoder, LLM-in-the-loop Thematic Analysis, Interview-Informed Generative Agents (зона 2); ReAct-агент для разбора причин от Microsoft Research, изоляция причины у Meta, постмортемы Datadog (зона 3); InsightPilot, Finch у Uber, внутренний дата-агент OpenAI, project44 (зона 4); error-analysis-first eval loop Хусейна и Шанкар, EDDOps, Tax AI (зона 5). Причина, по которой их не нашли мои проходы, повторяется: они искали слово «методология» и «процесс», Codex шёл через инженерные блоги компаний и рецензируемые публикации.
  • Числа, меняющие оценку зон. Meta: истинный виновник в top-5 в 42% расследований — это лучший из найденных замеров разбора причины на реальном масштабе, и он обесценивает вендорские «до 95%». Interview-Informed Generative Agents: агенты воспроизводят распределение ответов, но плохо воспроизводят конкретного человека — около 67% индивидуальной согласованности; эта цифра точнее объясняет раскол вокруг синтетики, чем общий вердикт «не работает».
  • Error-analysis-first eval loop как единственный кандидат на «промышленную практику» в зоне 5. У него независимые внедрения (не самоотчёт автора о себе), вендор-нейтральность заявлена и подтверждена рекомендацией начинать без платформы, и он ближе всего к тому, что нам самим нужно в зоне 5.
  • Критика рамки — целиком, как задание на второй этап. Восемь пунктов, которые я считаю справедливыми: у находки нет поля «тип» (методология, паттерн, исследовательский протокол, формат артефакта и продуктовая функция валятся в один список); определение методологии слишком слабое — «процесс, роли ИЛИ артефакты» пропускает материал, где есть один из трёх; зрелость смешивает три независимые оси (масштаб внедрения / качество доказательства / автономность); «модель-агностичность» недостаточна и должна быть заменена на переносимость по стеку (модель, оркестрация, семантический слой, наблюдаемость, права, хранилище артефактов); нет сквозного контура между зонами; не заданы права на решение (кто делегирует, каков лимит риска, сколько действует полномочие, что при недоступности человека); нет экономики агента (стоимость на исход, цена ошибочного действия, условие «автоматизация дороже ручного»); нет жизненного цикла артефакта (владелец, версия, срок годности, правило удаления).
  • Раздел про маркетинг — как готовый детектор. Двадцать терминов, звучащих как процесс и процессом не являющихся, каждый с проверочным вопросом. Три самых полезных для нас: AIOps — проверка «система сама выбирает следующий диагностический шаг или только ранжирует события?»; self-healing — «есть ли выбор действия, политика радиуса поражения, проверка восстановления и откат, или это выполнение готового runbook по алерту?»; human in the loop — «названы ли человек, момент вмешательства, видимое ему доказательство, срок, полномочие отклонить и поведение при тайм-ауте?».

Не взял.

  • Предложение переразбить зоны. Codex предлагает развести зоны 2 и 4 по артефакту, а не по названию (дискавери отвечает «что стоит проверить», оперирование — «какое повторяемое решение принять сейчас»); расщепить зону 3 на четыре цикла с разными правами агента (наблюдение / командование инцидентом / диагностика и смягчение / обучение после); расщепить зону 5 на три (управление конфигурацией агента, управление знанием и контекстом, управление самой методологией). Доводы сильные — особенно про зону 3, где оценивать одним уровнем автономии генерацию разбора причины и выполнение отката действительно опасно. Но зоны заданы тобой, разведка — не то место, где их меняют. Выношу как первый вопрос второго этапа, решение за тобой.
  • Систему ARGUS (якобы пять месяцев в проде с разбором бизнес-метрик) — всплыла в поиске одного из сборщиков, при попытке дойти до первоисточника вышли на другую работу, где ничего подобного нет. Если бы существовала, была бы самой ценной находкой зоны 4.
  • Тезис NIST AI Agent Standards Initiative про агентов, заводимых как обычные сервисные учётки, — пришёл из вендорского блога, первоисточник не открывался.

Что это значит для нашей методологии

Четыре следствия, которые видны из собранного и на которые опирается второй этап.

  1. Ниша есть, и она не в деливери. Там шесть команд сошлись на одной конструкции, и седьмая методология рынку не нужна. Незанятое место — сквозной контур: именованные артефакты, которые переходят из зоны в зону. Ни один найденный подход этого не делает.
  2. Зона 4 — самый дешёвый вход и самая пустая полка. Одна методология на всю зону, причина пустоты названа её же автором (тихий отказ), а ответственность за решение по цифрам не назначил никто во всей разведке.
  3. Три вещи можно взять готовыми, не изобретая. Ярусы автономии, привязанные к классу события, а не к агенту (сошлись пятеро независимо). Регресс-эвал на исторических случаях (две независимые реализации плюс два открытых бенчмарка). Разделение policy enforcement против context-as-guidance (Сбер) — то же, что «скилл — совет, хук — закон», но названное так, что переносится за пределы разработки.
  4. От «модель-агностичности» придётся отказаться в наивном виде. Переносимыми обязаны быть артефакты, роли и переходы; текст инструкций подгоняется под модель и, по замерам, смены модели не переживает.

Источники

Все ссылки прогнаны на отклик 02.09.2026. Полные карточки с артефактами, ролями и разбором — в drafts/: zona-1-deliveri.md, zona-2-discovery.md, zona-3-obsluzhivanie.md, zona-4-operirovanie.md, zona-5-upravlenie.md, codex-otvet.md.

Шесть ссылок из 87 не отдают содержимое автоматическому запросу — все шесть закрыты по доступу, а не мертвы:

  • три страницы openai.com (harness engineering, внутренний дата-агент, Tax AI) отдают 403 на любой скриптовый запрос — домен блокирует автоматизацию, в браузере страницы открываются. Содержание материала про harness engineering бралось через разбор InfoQ, что понижает точность деталей и отмечено в тексте;
  • два документа Gartner (Market Guide и Top Trends) платные; читались по вторичным цитатам в вендорских копиях и по пресс-релизу, что оговорено в карточках.

Плюс uber.com отдаёт 406 на скриптовый запрос — тот же случай блокировки автоматизации. Остальные 80 ссылок отвечают 200, документ IMDA — 202 (отложенная отдача файла).

Отдельно отмечено и не используется без оговорки: у страниц Cube, Amplitude и Databricks дата публикации не проставлена (стоит год), у ilert и спецификации agents.md даты на страницах нет вовсе и они установлены по первому снимку в веб-архиве — «не позже», а не точно. Тезис NIST и система ARGUS в отчёт не взяты, потому что первоисточник не открылся.