Разведка: рынок методологий AI-native по пяти зонам¶
Этап 1 проекта О проекте. Собрано 02.09.2026 по рамке Рамка разведки: пять зон, семь одинаковых вопросов к каждому подходу, шкала зрелости идея / пилоты / промышленная практика с обязательным указанием основания.
Собрано пятью зонными черновиками плюс отдельный заход внешней модели (Codex, gpt-5.6-sol) по зонам 2–5 — её вклад разобран в разделе «Что добавил второй движок». Черновики со всеми карточками — в drafts/.
Уже в базе, повторно не приношу. Плейбук Anthropic «The AI-Native SDLC» (Louis Claxton, 21.08.2026) разобран 27.08 → плейбук Anthropic: петля intent.md → spec.md → plan.md → PR → инцидент, «скилл — совет, хук — закон», ярусы автономии по сигмам, откат как самый отрепетированный путь. Он находкой разведки не считается и служит здесь точкой отсчёта, с которой сверяются остальные.
Итог одним экраном¶
- Гипотеза «деливери далеко впереди» верна наполовину. Дорога от намерения до дифа описана шестью независимыми командами, сошедшимися на одной конструкции. Дальше дифа процесс кончается: пропускная способность ревью, релиз и откат при агентном авторстве не описаны нигде.
- Дискавери не пуст — он густо заселён и почти не проверен. Две библиотеки агентных скиллов продакта на 33 тысячи звёзд суммарно, и ни в одной ни одного кейса с числом результата.
- Обслуживание — единственная зона со зрелым сводом, и тот написан Google про Google. Независимый замер отрезвляет: лучшие модели закрывают 11,4% реальных SRE-сценариев.
- Оперирование — самая пустая зона. Инструментов изобилие, методология ровно одна. Причина названа самим автором: тихий отказ, когда неверная сводка выглядит как верная, и обратной связи нет вовсе.
- Управление процессом за полгода обрело имя — harness engineering — и сразу же обзавелось эмпирикой, которая бьёт по его же предпосылке: контекстные файлы в общем случае не повышают долю решённых задач и поднимают стоимость на 20%+.
Сквозной вывод, который дороже любой отдельной находки: ни один из найденных подходов не переходит границу своей зоны. Пять зон — это пять несвязанных разговоров, ведущихся разными людьми в разных изданиях. Единственные два найденных шва между зонами — claude-code-discover, кладущий дискавери-артефакты туда, где их прочитает кодирующий агент (шов 2↔1, репозиторий на десять звёзд), и пайплайн Магнита, растящий гипотезы из базы прошлых экспериментов с оценённым эффектом (шов 2↔4, одна команда).
Зона 1 — Деливери¶
Зрелость: неравномерная. Путь «намерение → диф» — промышленная практика (шесть независимых команд сошлись на одной конструкции; разделение обязанностей доведено до нормы аудита в стандарте OWASP AISVS 1.0, релиз 24.06.2026). Всё после дифа — идея. Основание оценки: наличие независимого отраслевого стандарта с проверяемыми требованиями против полного отсутствия текстов с ролями по правой половине.
| Подход | Кто держит | Источник, дата | Зрелость (основание) | Привязка к вендору |
|---|---|---|---|---|
| Таксономия SDD: spec-first / spec-anchored / spec-as-source | Биргитта Бёкелер, Thoughtworks | martinfowler.com, 15.10.2025 | понятийная рамка (классифицирует чужое, ролей не задаёт) | нет |
| GitHub Spec Kit | GitHub, Ден Делимарский | github.blog, 02.09.2025 | промышленная по распространению (130K+ звёзд, v1.0), пилоты по доказанному эффекту (независимых замеров нет) | нет — 30+ агентов, процесс это markdown |
| AI-DLC | AWS, Raja SP | aws.amazon.com, 31.07.2025 | идея (в анонсе ни одного кейса с числами) | процесс нет, обвязка тянет Amazon Q и Kiro |
| RPI — Research → Plan → Implement | Борис Тане, Cloudflare | boristane.com, 10.02.2026 | пилоты (девять месяцев личной практики, сошлось с линиями Block и HumanLayer) | практика нет, изложение на Claude Code |
| Superpowers | Джесси Винсент | blog.fsck.com, 18.12.2025 | пилоты (~280K звёзд у плагина; воспроизводимых внедрений с числами не нашлось) | да — механика Claude Code в несущей конструкции |
| BMAD-METHOD | BMad Code | github.com/bmad-code-org, репозиторий создан 13.04.2025 | пилоты (воспроизводимых внедрений с числами не нашлось) | частично |
| OWASP AISVS, Приложение C | OWASP | github.com/OWASP/AISVS, 1.0 — 24.06.2026 | промышленная в статусе стандарта (191 проверяемое требование в двенадцати главах плюс 68 в Приложении C — проверяемые пункты аудита, а не советы) | нет по определению |
| spec-review | Александр Кальницкий, Mindbox | habr.com, 20.08.2026 | пилоты, близко к практике одной компании (11k кода + 18k тестов в проде без инцидентов, 30k RPS) | нет |
Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакт — цепочка markdown в репозитории: конституция проекта, спека, план, задачи (Spec Kit); research.md и plan.md, переживающие сжатие контекста (RPI); requirements.md в нотации EARS, design.md, tasks.md плюс steering-файлы со стандартами команды (Kiro — инструментальное воплощение AI-DLC); спека из восьми разделов, приёмочные тесты на Gherkin, журнал архитектурных решений (Mindbox). Человек утверждает конституцию и спеку, отвечает на вопросы шага уточнения и принимает результат; точка «человек сказал да» стоит на переходе от спеки к плану. Агенту отданы план, декомпозиция, реализация, кросс-артефактная сверка спеки с планом и задачами на противоречия — работа, которую раньше делал аналитик, — и ревью собственной работы чужими глазами: субагент-ревьюер стартует с чистым контекстом и потому не защищает код, который сам написал.
Что устоялось. Между «хочу» и «пишу код» вставляется утверждаемый человеком письменный артефакт, живущий в репозитории, а не в чате, — к этому пришли шесть команд, стартовавших с разных сторон. Разделение обязанностей формулируется на трёх уровнях сразу: как норма аудита (AISVS AC.8.1: агент не может одобрить, смёржить или задеплоить то, что сам породил, и ограничение обеспечивается системой контроля версий, а не политикой), как реализованная механика (Superpowers 4: spec-review и code-review — разные агенты, code-review берётся за качество кода только после того, как spec-review подписал соответствие плану), как архитектурный принцип (плейбук Anthropic).
Чего нет даже здесь. Пропускной способности пути «одобрено → в main»: команды с высокой долей ИИ мёржат почти вдвое больше PR, а метрики поставки не двигаются, потому что очередь на мёрж рассчитана на человеческую скорость (Tian Pan, 02.07.2026 — очередь с получасовым CI пропускает 48 PR в сутки). Ревью в масштабе: все подходы исходят из того, что находок столько, сколько человек прочитает. Релиза и отката при агентном авторстве: есть приёмы инфраструктуры, нет ролей.
Отрезвляющий замер. DORA 2025 (около 5000 респондентов, 90% используют ИИ): внедрение ИИ отрицательно связано со стабильностью поставки; ИИ работает усилителем существующих сильных и слабых сторон организации. Ни одна из найденных методологий не показывает, что её применение это снимает.
Зона 2 — Дискавери¶
Зрелость: пилоты. Основание: процессов описано много, прогонов почти нет — ни одна из четырёх найденных библиотек и конвейеров не приводит внедрения или числа результата; единственная крепкая эмпирика зоны отрицательная (сводка 12 рецензируемых работ по синтетическим пользователям) плюс одна количественная валидация в узком классе задач.
| Подход | Кто держит | Источник, дата | Зрелость (основание) | Привязка к вендору |
|---|---|---|---|---|
| Двухшаговый синтез интервью → дерево возможностей | Тереза Торрес / Vistaly | producttalk.org, 18.02.2026 | пилоты (альфа с набором по заявкам, партнёры без имён и чисел) | метод нет, реализация — Vistaly |
| Где AI помогает и где вредит в анализе интервью | Тереза Торрес | producttalk.org, 08.10.2025 | идея с личной проверкой (~30% прямых цитат от ChatGPT неверны — её собственный прогон) | нет |
| Недельный цикл дискавери в эпоху AI | Albers Advisory | albersadvisory.biz, 16.07.2026 | идея (авторы прямо признают: цикл целиком не прогоняли) | нет |
| pm-skills — 68 скиллов и 42 связанных workflow в девяти плагинах | Paweł Huryn | github.com/phuryn/pm-skills, создан 01.03.2026 | пилоты (25 919 звёзд — мера внимания; кейсов и чисел результата нет) | частично: markdown переносим, команды / от Claude |
| Product-Manager-Skills — 77 скиллов | Dean Peters | github.com/deanpeters, создан 05.02.2026 | пилоты (6 787 звёзд, кейсов нет) | нет — автор сознательно отказался от шаблонов Claude ради переносимости |
| claude-code-discover — дискавери-артефакты в репозитории кода | shinpr | github.com/shinpr, создан 23.03.2026 | идея (10 звёзд, ни одного числа) | да — плагин-маркетплейс Claude Code |
| Semantic Similarity Rating — синтетика с валидацией | PyMC Labs + Colgate-Palmolive | arXiv 2510.08338, 09.10.2025 | промышленная в узком классе (57 корпоративных опросов, 9 300 человеческих ответов, 90% от тест-ретест надёжности человека, две модели разных вендоров) | нет — проверено на GPT-4o и Gemini |
| Контр-позиция: синтетика не заменяет исследование | NN/g + MeasuringU | nngroup.com, 21.06.2024 · measuringu.com, 14.04.2026 | промышленная как критерий приёмки (сводка 12 рецензируемых работ: 9 обнадёживающих против 14 разочаровывающих, по качественной глубине 0 из 3) | нет |
| UXAgent — симулированные пользователи как пилот перед людьми | Lu, Yao et al. | arXiv 2502.12561, 18.02.2025, CHI 2025 | идея с прототипом (оценка на пяти UX-исследователях) | нет |
| Мульти-агентный тематический анализ | несколько академических групп | arXiv 2509.17167, 21.09.2025, и соседние работы | пилоты (несколько независимых рецензируемых прогонов на реальных корпусах; совпадение с ручным анализом ограничено) | нет, часть работ специально на открытых моделях |
| CollabCoder — совместное индуктивное кодирование | Jie Gao et al., SUTD / Notre Dame | CHI 2024, 11.05.2024 | пилоты (лабораторная оценка, 16 участников) | нет — трёхфазный процесс не зависит от функции OpenAI |
| LLM-in-the-loop Thematic Analysis | Dai, Xiong, Ku | Findings of EMNLP, 12.2023 | пилоты (два кейса, качество сопоставимо с человеческим кодированием) | протокол переносим, оценка только на GPT-3.5 |
| Interview-Informed Generative Agents | Zichao Wang, Alexa Siu | arXiv 2603.29890, 10.03.2026, CHI 2026 | пилоты (одно продольное исследование, N=51, 3 060 человеческих и столько же синтетических ответов) | архитектура переносима, доказательство на компонентах OpenAI |
| Пайплайн генерации гипотез из истории экспериментов | Иван Одинцов, Магнит | habr.com, 25.08.2026 | пилоты (одна команда с числами воронки: ~100 карточек → ~200 гипотез → ~50 после авто-ревью → 15 в бэклог) | нет — модель пайплайна в статье не названа |
| Continuous discovery на AI-модерируемых интервью | Perspective AI и соседи | getperspective.ai, 08.06.2026 | идея, поданная как практика («300 команд» без методики и выборки) | да — интервью ведёт их агент, данные у них |
| Прототип-первый дискавери в самой лаборатории | Cat Wu, Anthropic | claude.com, 19.03.2026 | пилоты (практика одной команды, внешние голоса из Decagon и Datadog) | ход «прототип вместо PRD» переносим |
Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты называют по-разному, но перечень сходится: снимок интервью (карта опыта, ключевые моменты, возможности, цитаты, факты), дерево возможностей, привязанное к исходу, карта допущений по четырёхрисковой модели, критерии отказа, записанные до прототипа, и — редкий случай — дискавери-документы, лежащие прямо в дереве проекта (docs/product/, docs/discovery/, docs/prd/), чтобы их прочитал кодирующий агент. У Магнита артефакт другой природы: база карточек прошлых экспериментов с оценённым бизнес-эффектом, из которой и растут гипотезы.
Роли разграничены тремя разными людьми и тремя разными фразами, рамки из этого не складывается: у Торрес агенту отдан нотетейкинг, синтез остаётся человеку; у BuildBetter (blog.buildbetter.ai, 28.08.2026 — конвейер из восьми скиллов кастомер-дискавери) интервью остаются человеческой работой, агент обслуживает планирование и приоритизацию вокруг них; у Albers агент обрамляет разбор — готовит материал до обсуждения и фиксирует после, — а само обсуждение ведут люди. Агенту в сумме отданы транскрибация, кодирование и тегирование, извлечение возможностей из одного интервью, генерация гипотез и их первичный отсев, дизайн эксперимента. Никто не описал, что происходит, когда агент ошибся.
Где сгущение. В двух точках, и обе смещены от собственно открытия. Синтез интервью: есть метод, есть его отрицание тем же автором, есть академическая проверка с честным «совпадение с ручным анализом ограничено». Синтетические респонденты: рынок за год развёлся надвое — количественный концепт-тест получил валидацию, качественная глубина получила вердикт 0 из 3.
Русскоязычный контур. Отстаёт не по инструментам, а по жанру: там, где на английском пишут процесс, по-русски пишут про респондента. Рынок синтетики измерен — около 0,12 млрд руб. в 2024 при общем рынке исследований 23,4 млрд (Эдгар Отченашенко, 21.11.2025), игроков не меньше шести, есть отраслевой опрос («Анкетолог», 10.08.2026: 68% уверены, что синтетика никогда не заменит живых полностью) и академический разбор границ применимости (Жуликов, «Интеракция», 03.07.2026). Описанного процесса дискавери с агентами — ни одного, кроме пайплайна Магнита.
Зона 3 — Обслуживание¶
Зрелость: пилоты с одним островом внутренней промышленной практики. Основание — три независимых свидетельства: ITBench (ICML 2025) — лучшие модели решают 11,4% реальных SRE-сценариев; SRE Report 2026 (Catchpoint/LogicMonitor, 418 практиков) — медианный toil 34%, около половины респондентов не видят от ИИ снижения рутины; и сами вендоры (Microsoft, Datadog, Rootly) рекомендуют начинать с режима чтения.
| Подход | Кто держит | Источник, дата | Зрелость (основание) | Привязка к вендору |
|---|---|---|---|---|
| SRE AI: ярусы L0–L4 и «Safety Trifecta» | Google SRE | cloud.google.com, 28.05.2026 · белая книга | пилоты, переходящие во внутреннюю практику одной компании (перечислены работающие системы с именами; публичных чисел по доле автономных закрытий нет) | несущая конструкция нет, реализация — Gemini, Vertex, ADK |
| Azure SRE Agent: incident response plan, режимы Review / Autonomous | Microsoft | learn.microsoft.com, 08.06.2026 | практика внутри одной компании (самоотчёт к GA: 35 000+ смягчённых инцидентов, 20 000+ сэкономленных часов в месяц; независимой проверки нет) | да — план описан в терминах ресурсов Azure |
| Investigations как самостоятельный артефакт | incident.io | incident.io, 02.07.2025 | пилоты (ни один клиент не назван; «до 80% сокращения MTTR» без методики) | процесс переносим, реализация на их платформе и Slack |
| Bits Investigation: цикл гипотез + методика оценки агента | Datadog, Shan и Ratchford | datadoghq.com, 12.01.2026 | пилоты (детальная инженерия и эвал-контур; «до 95%» — вендорское заявление) | методика оценки переносима полностью, агент привязан к их телеметрии |
| Модель зрелости AI SRE L0–L3 и 90-дневный переход | Rootly, Purvai Nanda | rootly.com, обновлено 03.08.2026 | идея, оформленная как методика (внятная процедура, ни одного названного внедрения) | нет |
| Agentic Incident Management Guide L1–L3 | ilert | ilert.com — даты публикации на странице нет (строка «Published» вшивается при сборке сайта: живая страница отдаёт одно значение, архивная копия от 07.12.2025 — другое, отстающее от даты обхода на двое суток); опубликована не позже 07.12.2025 по первому снимку web.archive.org | идея (ни внедрений, ни чисел) | нет |
| Уровни автономии агента L0–L5 | Cloud Security Alliance, Jim Reavis | cloudsecurityalliance.org, 28.01.2026 | идея (консорциумный документ без внедрений) | нет — вендор-нейтральный источник |
| AIOpsLab / парадигма AgentOps | Microsoft Research + Berkeley, UIUC, IISc | arXiv 2501.06706, 12.01.2025 | промышленная в нише оценки (открытый код, многоинституциональное авторство, стандарт сравнения) | нет |
| ITBench — 102 сценария SRE / CISO / FinOps | IBM Research | PMLR v267, ICML 2025 — сборник трудов конференции, дня публикации у тома нет | промышленная в нише оценки (рецензированная площадка, открытый код) | нет |
| Tool-using ReAct agent для RCA | Microsoft Research, Devjeet Roy et al. | FSE, 07.2024 | пилоты (оценка на отложенном наборе реальных инцидентов Microsoft; автономное исправление не исследовалось) | паттерн переносим, доказательство на закрытых данных |
| AI-assisted root-cause isolation | Meta Engineering | engineering.fb.com, 24.06.2024 | пилоты (внутреннее применение с бэктестом: истинный виновник в top-5 в 42% расследований) | да — fine-tuned Llama 2, внутренний граф кода, ~5 000 примеров |
| LLM-assisted постмортемы | Datadog, Le, Pieper, McGarvey | datadoghq.com, 23.09.2024 | пилоты (доведено до продукта, >100 часов на настройку структуры; независимых внедрений нет) | принцип «черновик, не автор вывода» переносим |
Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты зоны конкретнее, чем где-либо: runbook, который агент правит по факту использования в инциденте и порождает новые из закрытых инцидентов; расследование как самостоятельная сущность с findings и гипотезами; «context packet» — сводка с ранжированными гипотезами, где каждая проверяема и снабжена ссылкой на доказательство; incident response plan как именованная запись «фильтр инцидента → какой агент → какой уровень автономии»; черновик постмортема; handoff-документ при передаче дежурства.
Человек — дежурный и архитектор рамок; формулировка свода Google прямая: экспертиза смещается в задание жёстких границ системы, а не в ручное вмешательство. Агенты разведены по функциям — обнаружение аномалий, обработка алертов, расследование, оркестрация инцидента, постмортем, коммуникация. Что именно отдано агенту, определяется ярусом: только чтение и сбор контекста → диагностика без права менять → действие после одобрения плана → самостоятельное закрытие узкого класса инцидентов с внятным сигналом успеха и только обратимыми действиями.
Что устоялось и годится к переносу. Ярусы автономии как обязательный элемент разговора — к этому независимо пришли пятеро (Google L0–L4, CSA L0–L5, Rootly L0–L3, ilert L1–L3, Azure Review/Autonomous). Ключевая деталь из документации Azure: уровень автономии привязывается к классу инцидента, а не к агенту целиком. Условие входа в автономию жёстче всех сформулировано у Rootly: только обратимые действия. Google формулирует ограничение инструментов сильнее всех: любая система обязана поддерживать dry_run=true, а инструмент, которым пользуется агент, обязан быть неспособен уронить прод в одиночку, кем бы он ни вызывался.
Самое переносимое, что произвела зона — регресс-эвал агента на исторических инцидентах. Две независимых реализации (Google: ночные прогоны с LLM-судьёй и разметкой Bronze/Silver/Gold; Datadog: размеченные реальные инциденты с архивной телеметрией) и два открытых бенчмарка.
Чего нет. Независимого свода, написанного не продавцом. Обновления канона Google SRE под агентов — классическую книгу под агентов никто не переписал. Ответственности за автономное действие: ближайшее найденное — диалог «Autonomous mode acknowledgment» в Azure, где Microsoft перекладывает ответственность за область прав на заказчика.
Зона 4 — Оперирование¶
Зрелость: идея с одним пилотом промышленного качества. Основание: по признаку рамки полностью проходит ровно один текст. Инструментов при этом изобилие — Cube, ThoughtSpot, Amplitude, Databricks, dbt, Mixpanel выпустили агентов над своими данными, Gartner завёл под это категорию. Нет описанного порядка, в котором человек и агент вместе превращают цифры в решение.
| Подход | Кто держит | Источник, дата | Зрелость (основание) | Привязка к вендору |
|---|---|---|---|---|
| Четырёхслойный стек самообслуживаемой аналитики | дата-команда Anthropic | claude.com, 03.06.2026 | пилоты (работающий процесс одной компании с числами и признанием провалов; независимых воспроизведений нет) | четыре слоя переносимы, иллюстрация на Claude |
| Open Semantic Interchange v0.1 → Apache Ossie | консорциум (Snowflake, Salesforce/Tableau, dbt Labs) | snowflake.com, спека v0.1 — 27.01.2026; передача в Apache Incubator — 10.07.2026, ossie.apache.org | пилоты на пути к промышленной (опубликованная спека, управляющий орган в лице фонда, поддержка в независимых реализациях) | нет — над ним фонд, а не компания |
| Market Guide for Agentic Analytics | Gartner | gartner.com, редакция 2026; точной даты публикации в открытом доступе нет, документ платный | идея / рамка рынка (карта категории для закупщика) | нет; читалось по вторичным цитатам, текст платный |
| Decision Governance | Gartner | пресс-релиз, 11.03.2026 (домен закрыт для автоматических запросов, 403) | идея (ни одного описанного внедрения) | нет |
| InsightBench + AgentPoirot | ServiceNow Research | arXiv 2407.06423, подано 08.07.2024, принято на ICLR 2025 | промышленная в нише оценки (открытые код и данные, воспроизводимость) | нет — судья открытая модель |
| Цикл Ingest → Analyze → Explain → Recommend → Act | Databricks | databricks.com, 2026 — дата на странице не проставлена | идея (ни одного названного внедрения) | петля переносима, текст объясняет их платформу |
| Разделение труда между агентами над семантическим слоем | Cube | cube.dev, 2026 — дата на странице не проставлена | идея / ранние пилоты | мысль «агент выбирает из сертифицированных определений» переносима, остальное про Cube Cloud |
| Две фазы: insights и actions | Amplitude | amplitude.com, 2026 — дата на странице не проставлена | идея / ранние пилоты (ни одного клиента, ни одного числа) | да — понимание их таксономии событий объявлено преимуществом |
| Агентная аналитика как диагностика организации | Thomas in 't Veld, Tasman | tasman.ai, 05.01.2026 | идея (ни чисел, ни примеров реализации) | нет |
| InsightPilot — intent-driven exploratory analytics | Microsoft Research + HKUST | EMNLP, 12.2023 | пилоты (четыре дата-сайентиста, два датасета, 24 сравнения) | разделение вычисления и интерпретации переносимо; модель в статье не названа |
| Finch — финансовый дата-агент | Uber FinTech | uber.com, 17.07.2025 | пилоты (используется финансовыми командами; охват не опубликован; валидация критических запросов руководства — ещё roadmap) | модели заменяемы через их шлюз, практика завязана на Slack, LangGraph, внутренние витрины |
| Внутренний дата-агент с повторяемыми workflow | OpenAI | openai.com, 29.01.2026 (домен закрыт для автоматических запросов, 403; в браузере открывается) | пилоты (реальное использование в пяти функциях; доля пользователей и бизнес-эффект не раскрыты) | да — GPT-5.2, Codex, их эвалы и источники |
| Двухуровневый гипотезный разбор | project44, Chauhan и Sood | project44.com, 06.04.2026 | пилоты (сравнение с одним ручным разбором: все прежние факторы найдены, время ~в 16 раз меньше; 80–85% совпадения ключевых выводов на трёх запусках) | гипотезный процесс переносим, данные их |
Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты: канонические датасеты и метаданные как продукт; семантический слой с метриками и разрезами плюс граф зависимостей; процедурное знание в markdown двух видов — knowledge skill, сужающий пространство поиска, и runbook skill, кодирующий рабочий ход старшего аналитика; эвал-набор с эталонными ответами. У остальных — журналы решений и следы аудита, панели наблюдения за поведением агента.
Роли разграничены жёстче, чем в любой другой зоне, и во всех источниках одинаково: определения метрик пишет и версионирует человек, агент из них выбирает. За человеком также ведение справочной документации, эталонные ответы для эвалов, ревью содержания skills по доменам и качество данных. Агенту отдано сопоставление вопроса сущностям модели, обращение к семантическому слою, генерация и исполнение SQL, обнаружение аномалий, объяснение и выработка рекомендации — у Anthropic это 95% запросов бизнес-аналитики. Чего никто не отдал агенту и не оставил явно человеку — подпись под решением, принятым по сводке.
Единственная полная методология зоны — четыре слоя Anthropic, и она сама сообщает, где дырява. Data Foundations → Sources of Truth (семантический слой, цель «одно число»: метрика разрешается одинаково в дашборде, в ноутбуке и в разговоре с агентом) → Skills (процедурное знание в markdown; knowledge skill сужает поиск примерно до 30 курируемых файлов, runbook skill кодирует ход старшего аналитика) → Validation (офлайн-эвалы, абляционные тесты, онлайн-мониторинг). За человеком оставлено прямо перечисленное: определения метрик курируются руками и не генерируются автоматически, ведение справочной документации, эталонные ответы для эвалов, ревью содержания skills.
Два измеренных факта оттуда, экономящих чужой год: без структурированных skills точность упирается в 21%, с ними — устойчиво выше 95%; а наваливание агенту всего исторического корпуса запросов сдвинуло точность меньше чем на процентный пункт — узкое место не в объёме сведений, а в их структуре.
Три наблюдения, которые я считаю выводом, а не пересказом.
- Зона сместила разговор с процесса на определения. Все источники независимо упираются в семантический слой: Anthropic — «одно число», Tasman — «внутренний API-контракт между командами», OSI — общий формат, Gartner — семантическая согласованность как фактор расхождения лидеров. Отраслевой диагноз: типовой провал агентной аналитики — не галлюцинация, а семантическая ошибка (взял не ту таблицу, соединил не на том уровне детализации). Договориться о процессе нельзя, пока не договорились о метриках.
- Тихий отказ как причина пустоты. Anthropic называет нерешённым правдоподобный неверный ответ, расходящийся по компании без возражений. В зоне 3 ошибка агента видна — прод падает. В зоне 4 неверная сводка выглядит ровно как верная. Процесс без обратной связи в методологию не складывается — отсюда у зоны есть слои, стандарты и продукты, но нет цикла.
- Ответственности не назначил никто. «Человек остаётся ответственным за интерпретацию» встречается у Anthropic, Tasman, Databricks и в русском контуре — и ни у кого не превращено в процедуру: кто подписывает, что подписывает, что происходит, если сводка была ошибочна. Ближайшее — формулировка Gartner, что вопрос смещается от «кто нажал кнопку» к «какой guardrail допустил исход», и это лозунг.
Русскоязычный контур пуст по методологии. Лучшее найденное — Олег Игнатов, Garage Eight, 17.02.2026 с одной фразой про разграничение: «алгоритм может подсказать, где „что-то не так“, но понять, почему это произошло и что с этим делать — задача человека». Остальное по этим запросам — подборки «ТОП-10 BI-систем».
Зона 5 — Управление процессом¶
Зрелость: пилоты, с одной полосой промышленной практики и одной — промышленного измерения. Основание: распространение файлов инструкций — практика (60 000+ репозиториев с AGENTS.md, ~20 инструментов, стандарт под Linux Foundation, кольцо Adopt у Thoughtworks); измерение зоны — практика в исследовательском смысле (четыре независимые группы за полгода, выборки в тысячах репозиториев); сопровождение методологии как процесс — идея с двумя пилотами; производственной метрики качества харнеса нет вовсе.
| Подход | Кто держит | Источник, дата | Зрелость (основание) | Привязка к вендору |
|---|---|---|---|---|
| Harness engineering: guides (feedforward) и sensors (feedback) | Биргитта Бёкелер, Thoughtworks | martinfowler.com, 02.04.2026 | идея с примерами (названы OpenAI и Stripe; количественных данных нет) | нет |
| Agent Harness Engineering как зонтичная дисциплина | Адди Османи, O'Reilly Radar | oreilly.com, 15.05.2026 | пилоты (Terminal Bench 2.0: одна модель в разных харнесах даёт разное — харнес весит больше выбора модели) | нет, с оговоркой про co-training |
| Харнес-инжиниринг с измеряемым циклом | Вивек Триведи, LangChain | langchain.com, 17.02.2026 | пилот с числами (52,8% → 66,5% на Terminal Bench 2.0 без смены модели; внедрение одно — своё) | да — цикл построен на LangSmith; авторы подчёркивают, что харнес надо подгонять под модель |
| Harness engineering у Codex | OpenAI | openai.com, 02.2026 — точный день не установлен, страница недоступна автоматическому запросу (страница отдала 403, читалось через InfoQ) | пилот с крупными числами, одно внедрение (пять месяцев, ~млн строк беты, ноль строк руками, ~10×; внешнего подтверждения нет) | да |
| Curated shared instructions + feedback flywheel | Thoughtworks Technology Radar | radar: инструкции — Adopt, 11.2025 · radar: маховик — Assess, 04.2026 | практика в части инструкций (Adopt = применяем по умолчанию, сотни клиентских команд), идея в части маховика | нет |
| AGENTS.md как стандарт | Agentic AI Foundation, Linux Foundation | agents.md — спецификация версий и дат не несёт; опубликована не позже 10.03.2025 по первому снимку web.archive.org | практика по распространению (60 000+ проектов, ~20 инструментов); процесса управления и версионирования у стандарта нет | нет по построению |
| Что в этих файлах реально лежит | Galster et al. | arXiv 2602.14690, подано 16.02.2026, финальная версия 30.06.2026, AIware 2026 | промышленная в измерении (2 853 репозитория, пять инструментов) | нет |
| Эмпирика против: помогают ли контекстные файлы | Gloaguen et al., SRI Lab, ETH Zürich | arXiv 2602.11988, 12.02.2026 | промышленная в измерении (разные LLM, разные агенты, файлы и сгенерированные, и написанные людьми) | нет |
| Конфигурационные запахи в SKILL.md | Hong, Imani, Ahmed | arXiv 2607.01456, 01.07.2026 | промышленная в измерении (238 реальных скиллов; >99% содержат хотя бы один запах) | нет |
| Skill Eval: pass@k против pass^k | Минко Гечев | blog.mgechev.com, 26.02.2026 | идея с работающим инструментом (внедрений не названо) | нет — Gemini, Antigravity, Claude |
| Пирамида тестов харнеса: hook / skill / workflow | Ранджан Кумар | ranjankumar.in, 15.07.2026 | идея с одним рассказанным кейсом | да — CLI и модели Anthropic; паттерны переносимы |
| Замкнутый цикл «ревью → правило» | Aggarwal, Ghalaty | arXiv 2607.13091, 13.07.2026 | пилот с числами (35+ микросервисов, свод вырос с 5 до 18 правил, 0% повторения классов ошибок, на которые есть правило) | нет — перенос правил между интерфейсами заявлен как результат |
| Автоэволюция харнеса без человека | Lin et al., Fudan | arXiv 2604.25850, 28.04.2026 | идея, проверенная на бенчмарке (Terminal-Bench 2: 69,7% → 77,0% за десять итераций) | нет; ⚠️ ровно то, что Thoughtworks помечает «пока не рекомендуем» |
| Harness-Bench: способность заявляется парой «модель+харнес» | Yao et al. | arXiv 2605.27922, 27.05.2026 | пилоты / исследование (106 задач, 5 194 траектории) | нет |
| Организационная память для агентов | Kirchdorfer et al. | arXiv 2607.03228, 03.07.2026 | идея с proof-of-concept (закупочный сценарий, чисел нет) | нет |
| Index sickness: когда правил становится слишком много | Zhang, Song | arXiv 2606.19121, 17.06.2026 | пилот-одиночка (391 последовательная сессия; объём инструкций сокращён ~на 75%, рецидивов не было ~150 сессий) | нет |
| Prompt governance: критика самого допущения | Neumann, Sargeant, Singh | arXiv 2606.07539, подано 29.04.2026, принято на ACM FAccT 2026 | идея / критика с академическим весом | нет |
| Model AI Governance Framework for Agentic AI | IMDA, Сингапур | imda.gov.sg, 22.01.2026, обновлён 20.05.2026 | регуляторная рамка, соблюдение добровольное; первая в мире именно под агентов | нет |
| Error-analysis-first eval loop | Hamel Husain, Shreya Shankar | hamel.dev, 28.05.2025, обновлено 01.09.2026 | промышленная практика (метод преподан 700+ инженерам и PM, независимые продуктовые кейсы — например Nova Escola, ~1 млн пользователей в месяц, ежедневные эвалы на 2% трафика) | нет — авторы рекомендуют начинать с ноутбука и эксперта, а не с платформы |
| EDDOps — Evaluation-Driven Development and Operations | Xia, Lu, Zhu et al., CSIRO Data61 | arXiv 2411.13768, актуальная версия 17.11.2025 | пилоты (выведено из обзора 134 академических и 27 практических источников, инстанцировано на пред-продакшн ассистенте) | нет — архитектура рассчитана на замену модели и инструментов |
| Production evidence → eval target → bounded agent task | Thrive Holdings, OpenAI, сеть Crete | openai.com, 27.05.2026 (403 для автоматических запросов) | пилоты крупного масштаба (30+ бухгалтерских фирм, 7 000 деклараций; за шесть недель доля деклараций с ≥75% корректных полей выросла с 25% до 86%) | схема переносима, реализация на Codex |
| AI-Disrupt PDLC | Кирилл Меньшов, Сбер | ЦИПР, 19.05.2026; v2.0 — 07.2026, ria.ru; разборы — habr.com (v1.0) и popovs.tech (v2.0) | практика в части GigaCode (14 000 разработчиков, доля принятого AI-кода 45% → 69%), пилот в части самой методологии (при 175 страницах v2.0 собственных метрик внедрения в документе нет — по разбору Попова) | методология переносима, реализация на GigaCode и российский регуляторный контур |
Артефакты, роли, что отдано агенту (вопросы 2–4 рамки). Артефакты: файлы инструкций (AGENTS.md, CLAUDE.md, rules-файлы), уложенные в baseline-репозиторий, из которого скаффолдятся новые сервисы, — так обновление шаблона расходится по командам само; набор поведенческих правил с автоматической валидацией целостности и чеклист самопроверки, исполняемый агентом до сдачи; эвал-наборы с историей прогонов, привязанной к версии конфигурации; трейсы как основной материал наблюдения; хуки на точках жизненного цикла.
Человек здесь — «на контуре», а не внутри него: он правит харнес, наблюдая повторяющиеся сбои агента, и каждое ограничение обязано быть прослежено до конкретного сбоя, а не придумано впрок. Агент внутри контура — объект регуляции, не её субъект. Отдано агенту немногое и с оговорками: разбор собственных трейсов на ошибки, самопроверка по чеклисту перед сдачей. Крайний случай — харнес, который правит себя сам, — существует и проверен на бенчмарке, но Thoughtworks помечает его «пока не рекомендуем к общему применению»: риск разрастания контекста и шумной обратной связи, уводящей агента.
Что сложилось быстрее, чем ожидалось. Слово: «harness engineering» за полгода прошло путь от блога до вакансий в Cursor, Intel и Instabase и до статьи на сайте Фаулера; конкурирующего термина нет. Разделение вклада модели и вклада обвязки: Harness-Bench требует заявлять способность на уровне пары «модель+харнес», LangChain меряет это на себе (+13,7 п.п. без смены модели), Сбер оценивает вклад детерминированной обвязки в 98%. Разворот от «пишите больше инструкций» к «пишите меньше»: ETH Zürich — файлы не помогают и стоят 20%+; Zhang и Song — минус 75% объёма и болезнь ушла.
Главное натяжение зоны. Между «правило как способ управления» и эмпирикой, которая говорит, что правила работают не так, как предполагается. Отрасль отвечает тем же ходом, что и плейбук Anthropic: перевести обязательное в детерминированный слой, оставив тексту рекомендательную роль. У Сбера это разведено терминологически — policy enforcement против context-as-guidance; полезнейшая формулировка, привезённая разведкой.
Чего не написано и написать некому. Как ревьюят изменение свода правил, кто подписывает, что происходит при конфликте двух правил, как правило устаревает и удаляется. Ближе всех Aggarwal и Ghalaty с автоматической валидацией целостности набора — и там 18 правил на 35 сервисов. Процедуры вывода правила из обращения нет ни у кого.
Модель-агностичность: где реальна, где заявлена¶
Сквозное требование проекта проверялось у каждого подхода отдельно (колонка «привязка» в таблицах выше). Картина по типам.
Реально переносимо — конструкция не опирается ни на модель, ни на платформу: отраслевые стандарты и рамки (OWASP AISVS, CSA L0–L5, OSI, IMDA), академические работы и бенчмарки (AIOpsLab, ITBench, InsightBench, Harness-Bench, эмпирика ETH), методики с процедурой вместо инструмента (Rootly L0–L3, error-analysis-first evals Хусейна, EDDOps, замкнутый цикл «ревью → правило», Product-Manager-Skills — единственная библиотека, где переносимость была осознанной целью автора).
Переносим процесс, но не реализация — самая населённая категория: четыре слоя Anthropic, свод Google SRE, двухшаговый синтез Торрес, spec-review Mindbox, AI-DLC, Spec Kit, Superpowers, Tax AI, AI-Disrupt PDLC. Идея снимается с носителя, обвязка — нет.
Вендор в несущей конструкции — Azure SRE Agent (план описан в терминах ресурсов Azure), Amplitude (понимание их таксономии событий объявлено конкурентным преимуществом), Perspective AI (интервью ведёт их агент, данные у них), Meta RCA (дообученная модель плюс внутренний граф кода), claude-code-discover и пирамида тестов харнеса (требуют механики Claude Code).
Особый случай, ломающий привычное понимание агностичности. LangChain показывает измерением, что харнес нужно подгонять под модель, а не переносить: более ранняя версия их харнеса на Claude Opus 4.6 дала 59,6% — на 6,9 п.п. ниже финального результата на gpt-5.2-codex, причём тот же цикл улучшений под Claude авторы не прогоняли. Османи добавляет механизм: co-training приводит к тому, что модель переобучается под харнес, в котором её тренировали. Это значит, что «модель-агностик» в нашем случае — свойство процесса и артефактов, а не конфигурации. Артефакты, роли и переходы обязаны пережить смену модели; конкретный текст инструкций — не обязан и, судя по замерам, не переживёт.
Формулировка, которую стоит забрать в методологию дословно (Codex, раздел про маркетинг): единый API-адаптер доказывает заменяемость endpoint, но не переносимость качества, семантики промптов, поведения при работе с инструментами и безопасности. Агностичность интеграции ≠ агностичность методологии.
Белые пятна¶
Восемь мест, где методологии нет. По каждому — что искали и что вернулось вместо.
-
Ответственность за решение, принятое по агентной сводке (зона 4). Искали:
"agentic analytics" framework accountability who owns the decision AI insight human review process,agent generated insights human trust verification "decision log" analytics governance practice case study numbers. Вернулось: общие рамки управления агентами (CSA, IMDA, препринты про безопасность агентов) — они про агентов вообще, не про решения по цифрам. Ни одной компании, описавшей, как устроена подпись под таким решением. Самое большое пятно всей разведки. -
Метрика качества дискавери (зона 2). Искали:
how to evaluate quality of AI-assisted discovery output evals product research rubric,discovery quality metrics. Вернулось: эвалы для LLM-продуктов вообще, рубрики для академических работ, LLM-as-a-judge как приём. Рынок научился мерить выход модели и не умеет мерить выход открытия. Ближайшее к нужному — оценка качества входа (доля «историй» против «мнений» в транскрипте) в заброшенном учебном репозитории на три звезды. -
Приоритизация продуктовых гипотез агентом как метод (зона 2). Искали:
hypothesis prioritization with LLM product experiment backlog agentic RICE evidence. Вернулось: контент-маркетинг про RICE/ICE/Kano вообще без агентов и академические работы про приоритизацию генов. Есть промпт «оцени по RICE» и ровно один корпоративный пайплайн — Магнит. -
Производственная метрика качества харнеса (зона 5). Искали:
measuring harness quality metrics coding agent "eval" instruction file impact benchmark study. Вернулись только исследовательские бенчмарки: измеряют исследователи для сравнения, а не команды для управления. Бёкелер называет эту дыру в апреле — к сентябрю она на месте. -
Внутренняя роль владельца харнеса (зона 5). Искали:
"harness engineer" OR "agent experience engineer" job posting hiring team owns skills hooks rules company,"AI enablement" team role platform engineering for coding agents ownership 2026 case study. Вернулось: четыре продуктовых вакансии (Cursor, Intel, Instabase, Geniee) — все строят харнес на продажу; обзоры «профессий будущего»; вендорский список из шести ролей без указания, кто именно сопровождает харнес. Ни одного описания «в компании X за файлы правил отвечает Y, ревью проходит так-то». -
Процесс «одобрено → в прод» при агентной скорости (зона 1). Искали:
continuous integration for AI agents merge queue progressive delivery rollback agent speed deployment safety 2026 practice. Вернулось: материалы про выкатку самих моделей — это другая тема, описанная гораздо лучше, — и одна честная инженерная статья про очередь на мёрж. Методологии с ролями нет. -
Выдача агенту права записи в прод как описанная процедура (зона 3). Искали (заход Codex):
LLM agent on-call autonomy levels,agent production remediation approval rollback,autonomous SRE incident lifecycle. Не найдено независимого промышленного процесса: классификация действия по радиусу поражения, двойное подтверждение, срок действия полномочия, автоматическая проверка восстановления, отзыв автономии. Публичные материалы заканчиваются на разборе причины или описывают превью облачного продукта. -
Управление организационной памятью: чей факт, какой у него срок годности (зона 5). Искали:
organizational agent memory governance,prompt instruction versioning ownership workflow,RAG as a process not architecture ownership lifecycle knowledge base curation. Вернулись обзоры архитектуры и рынок инструментов управления промптами. Кто владеет фактом, когда он устаревает, кто разрешает противоречия, как изменение контекста проходит ревью и откат — не описано. Единственное именованное решение задачи версионирования контекста — сберовский Context Supply Chain, и он описан на уровне названия.
Отдельно: чего не нашлось, потому что этого нет ни у кого. Сквозного контура между зонами. Каждая зона производит артефакты, которые не читаются соседней: дискавери не отдаёт деливери ничего именованного, обслуживание не возвращает дискавери разбор инцидента как источник гипотез, оперирование не замыкается на приоритизацию. Два найденных исключения — claude-code-discover (репозиторий на десять звёзд) и пайплайн Магнита (одна команда, публикация на Habr) — вес имеют не по зрелости, а по тому, что кроме них швов нет.
Что добавил второй движок¶
Codex (gpt-5.6-sol) заходил отдельно по зонам 2–5 с тем же файлом рамки и без доступа к результатам зонных сборщиков. Полный ответ — drafts/codex-otvet.md.
Взял.
- Тринадцать подходов, которых не было ни в одном из зонных черновиков и которые вошли в таблицы выше: CollabCoder, LLM-in-the-loop Thematic Analysis, Interview-Informed Generative Agents (зона 2); ReAct-агент для разбора причин от Microsoft Research, изоляция причины у Meta, постмортемы Datadog (зона 3); InsightPilot, Finch у Uber, внутренний дата-агент OpenAI, project44 (зона 4); error-analysis-first eval loop Хусейна и Шанкар, EDDOps, Tax AI (зона 5). Причина, по которой их не нашли мои проходы, повторяется: они искали слово «методология» и «процесс», Codex шёл через инженерные блоги компаний и рецензируемые публикации.
- Числа, меняющие оценку зон. Meta: истинный виновник в top-5 в 42% расследований — это лучший из найденных замеров разбора причины на реальном масштабе, и он обесценивает вендорские «до 95%». Interview-Informed Generative Agents: агенты воспроизводят распределение ответов, но плохо воспроизводят конкретного человека — около 67% индивидуальной согласованности; эта цифра точнее объясняет раскол вокруг синтетики, чем общий вердикт «не работает».
- Error-analysis-first eval loop как единственный кандидат на «промышленную практику» в зоне 5. У него независимые внедрения (не самоотчёт автора о себе), вендор-нейтральность заявлена и подтверждена рекомендацией начинать без платформы, и он ближе всего к тому, что нам самим нужно в зоне 5.
- Критика рамки — целиком, как задание на второй этап. Восемь пунктов, которые я считаю справедливыми: у находки нет поля «тип» (методология, паттерн, исследовательский протокол, формат артефакта и продуктовая функция валятся в один список); определение методологии слишком слабое — «процесс, роли ИЛИ артефакты» пропускает материал, где есть один из трёх; зрелость смешивает три независимые оси (масштаб внедрения / качество доказательства / автономность); «модель-агностичность» недостаточна и должна быть заменена на переносимость по стеку (модель, оркестрация, семантический слой, наблюдаемость, права, хранилище артефактов); нет сквозного контура между зонами; не заданы права на решение (кто делегирует, каков лимит риска, сколько действует полномочие, что при недоступности человека); нет экономики агента (стоимость на исход, цена ошибочного действия, условие «автоматизация дороже ручного»); нет жизненного цикла артефакта (владелец, версия, срок годности, правило удаления).
- Раздел про маркетинг — как готовый детектор. Двадцать терминов, звучащих как процесс и процессом не являющихся, каждый с проверочным вопросом. Три самых полезных для нас: AIOps — проверка «система сама выбирает следующий диагностический шаг или только ранжирует события?»; self-healing — «есть ли выбор действия, политика радиуса поражения, проверка восстановления и откат, или это выполнение готового runbook по алерту?»; human in the loop — «названы ли человек, момент вмешательства, видимое ему доказательство, срок, полномочие отклонить и поведение при тайм-ауте?».
Не взял.
- Предложение переразбить зоны. Codex предлагает развести зоны 2 и 4 по артефакту, а не по названию (дискавери отвечает «что стоит проверить», оперирование — «какое повторяемое решение принять сейчас»); расщепить зону 3 на четыре цикла с разными правами агента (наблюдение / командование инцидентом / диагностика и смягчение / обучение после); расщепить зону 5 на три (управление конфигурацией агента, управление знанием и контекстом, управление самой методологией). Доводы сильные — особенно про зону 3, где оценивать одним уровнем автономии генерацию разбора причины и выполнение отката действительно опасно. Но зоны заданы тобой, разведка — не то место, где их меняют. Выношу как первый вопрос второго этапа, решение за тобой.
- Систему ARGUS (якобы пять месяцев в проде с разбором бизнес-метрик) — всплыла в поиске одного из сборщиков, при попытке дойти до первоисточника вышли на другую работу, где ничего подобного нет. Если бы существовала, была бы самой ценной находкой зоны 4.
- Тезис NIST AI Agent Standards Initiative про агентов, заводимых как обычные сервисные учётки, — пришёл из вендорского блога, первоисточник не открывался.
Что это значит для нашей методологии¶
Четыре следствия, которые видны из собранного и на которые опирается второй этап.
- Ниша есть, и она не в деливери. Там шесть команд сошлись на одной конструкции, и седьмая методология рынку не нужна. Незанятое место — сквозной контур: именованные артефакты, которые переходят из зоны в зону. Ни один найденный подход этого не делает.
- Зона 4 — самый дешёвый вход и самая пустая полка. Одна методология на всю зону, причина пустоты названа её же автором (тихий отказ), а ответственность за решение по цифрам не назначил никто во всей разведке.
- Три вещи можно взять готовыми, не изобретая. Ярусы автономии, привязанные к классу события, а не к агенту (сошлись пятеро независимо). Регресс-эвал на исторических случаях (две независимые реализации плюс два открытых бенчмарка). Разделение
policy enforcementпротивcontext-as-guidance(Сбер) — то же, что «скилл — совет, хук — закон», но названное так, что переносится за пределы разработки. - От «модель-агностичности» придётся отказаться в наивном виде. Переносимыми обязаны быть артефакты, роли и переходы; текст инструкций подгоняется под модель и, по замерам, смены модели не переживает.
Источники¶
Все ссылки прогнаны на отклик 02.09.2026. Полные карточки с артефактами, ролями и разбором — в drafts/: zona-1-deliveri.md, zona-2-discovery.md, zona-3-obsluzhivanie.md, zona-4-operirovanie.md, zona-5-upravlenie.md, codex-otvet.md.
Шесть ссылок из 87 не отдают содержимое автоматическому запросу — все шесть закрыты по доступу, а не мертвы:
- три страницы
openai.com(harness engineering, внутренний дата-агент, Tax AI) отдают 403 на любой скриптовый запрос — домен блокирует автоматизацию, в браузере страницы открываются. Содержание материала про harness engineering бралось через разбор InfoQ, что понижает точность деталей и отмечено в тексте; - два документа Gartner (Market Guide и Top Trends) платные; читались по вторичным цитатам в вендорских копиях и по пресс-релизу, что оговорено в карточках.
Плюс uber.com отдаёт 406 на скриптовый запрос — тот же случай блокировки автоматизации. Остальные 80 ссылок отвечают 200, документ IMDA — 202 (отложенная отдача файла).
Отдельно отмечено и не используется без оговорки: у страниц Cube, Amplitude и Databricks дата публикации не проставлена (стоит год), у ilert и спецификации agents.md даты на страницах нет вовсе и они установлены по первому снимку в веб-архиве — «не позже», а не точно. Тезис NIST и система ARGUS в отчёт не взяты, потому что первоисточник не открылся.