Примечание к ревизии от 5 октября 2026 года: нормализована пунктуация английской версии. Факты, источники и редакционные выводы не менялись.
Прошедшая неделя выглядела как неделя витрины. Компьютерное управление и два новых интерфейса вышли в общий доступ, платёжный гигант объявил о соглашении о покупке маршрутизатора моделей, появились ускорители инференса и новые агенты. А если открыть не ленту новостей, а статус-страницы тех же компаний, видна вторая неделя — та, в которой сервисы падали почти каждый день.
Это один и тот же семидневный отрезок. И расхождение между двумя его версиями — самое полезное, что можно унести из этой недели в свою работу.
Что изменилось на самом деле
Anthropic в собственной публичной ленте инцидентов зафиксировала за неделю семь отдельных событий: деградацию нескольких моделей, отдельно деградацию Claude Opus 5 и Claude Haiku 4.5, повышенные ошибки запросов, сбой коннекторов Google и три инцидента подряд в последний день окна — повышенные ошибки моделей и дважды проблемы со входом в Claude.ai. Источник: status.claude.com
У OpenAI за тот же отрезок — пять записей: ошибки публикации Sites, три инцидента в один день, включая отказ регистрации и входа на chatgpt.com, и неожиданные разлогинивания пользователей. Источник: status.openai.com
Двенадцать инцидентов за семь дней у двух компаний, которые на этой же неделе показывали новые возможности. Причём у Anthropic серия началась ещё до окна: предыдущая неделя в ленте идёт почти сплошняком. Источник: status.claude.com
Оговорка, без которой цифра врёт: статус-страница считает объявленные инциденты, а не их тяжесть и не длительность. Семь записей — не семь одинаковых аварий. И сравнивать счёт между вендорами нельзя: у компаний разные пороги объявления и разная детализация. Это не рейтинг надёжности. Это доказательство того, что деградация на таком уровне — условие, которое нужно учитывать в рабочем процессе, а не редкое ЧП.
Запуск — это обещание. Аптайм — это выполненное обещание. Дешевеет первое, а отвечаете вы за второе.
Коротко: сигналы недели
01. Компьютерное управление вышло из беты — вместе с ответственностью за то, что агент нажмёт
По данным Anthropic, в общий доступ переведены computer use (управление интерфейсом: агент смотрит на экран и сам кликает, печатает, прокручивает), Skills API и Files API, а также добавлен инструмент работы с браузером; хранилище выросло до терабайта на организацию, лимиты — впятеро, и computer use теперь допускает несколько действий за ход вместо одного.
Общий доступ описывает интерфейс, а не надёжность того, что вы на нём построите, и приведённое сокращение процесса взято из одного вендорского клиентского кейса. Прежде чем давать агенту право кликать в рабочей системе, выпишите список действий, которые он может совершить необратимо — оплата, отправка, удаление, — и закройте их подтверждением человека.02. Лучшие модели по метрике оказались лучшими и в воспроизведении чужих ошибок
Исследователи проверили одиннадцать моделей распознавания речи на «подгонку под бенчмарк» (benchmark — эталонный набор задач, по которому меряют качество). Шесть из одиннадцати воспроизвели ошибочные расшифровки эталона, противоречащие самой записи, и чаще других это делали модели с наименьшей частотой ошибок. На другом наборе сильнейшие модели восстанавливали скрытые числа примерно в трети случаев, хотя число было удалено, а несколько моделей почти безошибочно переключали орфографию — то есть узнавали, на каком наборе их тестируют. Источник: huggingface.co
Работа охватывает два набора данных и одиннадцать моделей — это не приговор всем бенчмаркам. Но вывод переносится прямо: публичная метрика показывает, как модель ведёт себя на публичной метрике. Соберите два десятка своих реальных случаев, которых нет в интернете, и меряйте выбор модели по ним.03. Toyota сократила сборку агента с месяцев до дней — а экономию пока только прогнозирует
По данным Toyota North America, создание одного внутреннего агента упало с шести месяцев силами шести инженеров до четырёх дней силами одного, диагностика на производстве — с пяти-шести часов до пары минут, а в проде работает более полусотни доменных агентов.
Обратите внимание, где кончается измеренное и начинается ожидаемое: суммы экономии в этом кейсе — прогноз компании, сформулированный в условном наклонении, а сам кейс опубликован поставщиком инструмента. Если вы приводите похожие цифры руководству, разделите их на две колонки — «замерено» и «ожидаем» — и защищайте только первую.04. Проверку сделала лаборатория, а не пресс-релиз
По данным Anthropic, Claude спроектировал белковые связки против пятнадцати мишеней и добился успеха на четырнадцати, заметно превзойдя типичную долю попаданий. Существеннее здесь другое: лабораторную проверку проводили независимые Adaptyv Bio и Twist Bioscience, а не сам вендор. При этом результаты не прошли рецензирование, одна мишень дала неопределённый результат, а против мальтозосвязывающего белка модель провалилась полностью.
Это рабочий шаблон доверия к чужому результату: смотрите не на то, насколько велика цифра, а на то, кто её измерял и названы ли провалы. Заявление, в котором нет ни одного неудачного случая, обычно означает, что вам показали не всё.05. Агент, который играет с экрана, — и осторожность, с которой его выпускают к людям
По данным Google DeepMind, агент SIMA 2 на базе Gemini читает экран, понимает инструкцию на обычном языке и работает клавиатурой и мышью в трёхмерных средах, включая No Man's Sky, Valheim и Hydroneer. Партнёрство со студией вселенной EVE начинается с офлайн-копии EVE Online, отдельной от живых игроков.
Полезен здесь не агент, а порядок его выпуска: сначала копия без последствий, потом среда с ограниченными последствиями, и только потом живые люди. Если вы запускаете агента на реальном процессе, повторите эту лестницу — на исторических данных, затем на малой доле потока, затем на всём.06. Инфраструктура под ИИ-разработку упирается не в модель, а в git
По данным Cursor, компания построила собственное хранилище git на объектном хранилище, потому что классическая репликация деградирует с ростом числа реплик; заявлены сотни отправок в секунду, средняя задержка чтения меньше десяти миллисекунд и линейное масштабирование чтения в синтетических тестах на сотне реплик.
Цифры синтетические и собственные, и команда сама говорит, что упёрлась в скорость упаковки данных самим git. Вывод для планирования: когда агенты начинают писать код в высоком темпе, узким местом становится не модель, а система хранения вокруг неё — считайте её мощность заранее.07. Маршрутизация моделей экономит десятки процентов — и ноль на отдельных сессиях
По данным Factory, выбор модели должен происходить в обвязке (harness — исполнительный слой агента, который держит состояние сессии), а не на шлюзе, потому что только там видно состояние кеша и результат задачи; компания заявляет снижение совокупной стоимости больше чем вдвое против постоянного использования топовой модели и почти полное сохранение доли прохождения на эталонных задачах.
Все цифры — собственные замеры вендора, и его же примеры сессий дают разброс от огромной экономии до полного её отсутствия. Медиана здесь не обещание: прежде чем закладывать экономию в бюджет, прогоните маршрутизацию на своих типовых задачах и посмотрите на худшую сессию, а не на среднюю.08. Тот же вопрос — противоположный ответ: платёжный сервис договорился купить маршрутизатор
По данным Stripe, компания объявила о соглашении о покупке OpenRouter — сервиса, который маршрутизирует и оптимизирует расход токенов по сотням моделей от десятков провайдеров. Финансовые условия в самом объявлении не раскрыты.
Широко разошедшиеся суммы сделки — из сообщений прессы, а не из заявления компании; соглашение о покупке — ещё не закрытая сделка. Практический смысл в другом: на одной неделе рынок дал два несовместимых ответа на вопрос «где живёт выбор модели» — в обвязке или на шлюзе. Значит, закладывать переносимость важнее, чем угадывать победителя: держите смену провайдера настройкой, а не переписыванием.09. Запускать чужой код стало быстро — но безопасность здесь не про скорость
Саймон Уиллисон проверил smolvm — песочницу с аппаратной изоляцией для запуска недоверенного кода на Python и JavaScript — и получил холодный старт около секунды и десятки миллисекунд на прогретом запуске; офлайн-образы, запуск без сети, лимиты процессора и памяти, тайм-ауты и монтирование входных данных только для чтения отработали как заявлено. Источник: simonwillison.net
Это один практический тест одной версии, а не аудит: автору даже пришлось перенести проверку в другую среду из-за отсутствия вложенной виртуализации. Если ваш агент исполняет сгенерированный код, вопрос не «быстро ли», а «что он может сделать, если ошибётся» — начните с запрета сети и записи наружу.10. Открытая наука как способ проверки: инструмент отдали сообществу
Microsoft Research расширила доступ к Skala — обученному функционалу для расчётов в химии и материаловедении. Новая версия обучена на существенно большем объёме данных, показывает лучший результат в большинстве подмножеств признанного эталона и встроена в открытые пакеты, доступные сообществу. Источник: microsoft.com
Точность на эталоне не равна предсказуемости на незнакомой химии, и цифры приводит та же группа, что строила метод. Но сам ход — отдать инструмент в открытые пакеты — делает результат проверяемым чужими руками. Это разумный критерий и для выбора поставщика: может ли кто-то, кроме продавца, воспроизвести заявленное.11. Оценку качества можно удешевить в разы — и вместе с ней отдать определение ошибки
По данным LangChain, управляемые оценщики сами навешивают оценку качества на рабочие диалоги и кратно снижают стоимость оценки. Первый оценщик доступен только на старших планах и только в США, требует минимум двух пар «человек — ИИ» в диалоге и отрабатывает в течение половины суток.
Экономия здесь настоящая, но вместе с судьёй наружу уезжает и критерий: что считать ошибкой, начинает определять поставщик. Оставьте у себя короткий эталонный набор, размеченный вашими людьми, и раз в месяц сверяйте с ним внешнего оценщика — расхождение и будет ценой удобства.12. Память агенту помогает не всем: слабой модели — заметная прибавка, насыщенной — ноль
IBM Research проверила на сотнях многошаговых задач, что даёт агенту накопленная память. Слабая модель заметно прибавила в доле выполненных задач при почти неизменном расходе токенов. Более сильная тоже прибавила, но ценой почти удвоенного расхода. А насыщенная модель не прибавила ничего. Источник: huggingface.co
Результат получен на одном наборе задач, и авторы это оговаривают. Но управленческий вывод устойчив: память — не универсальное улучшение, а обмен токенов на качество, и курс обмена зависит от модели. Прежде чем строить агенту «долгую память», замерьте, прибавляет ли она хоть что-то именно вашей модели.Что стало дешевле, а что — ценнее
По данным вендоров, подешевело почти всё, что связано с запуском: ускорители инференса дают кратный прирост скорости Источник: huggingface.co, маршрутизация срезает счёт Источник: factory.ai, автоматическая оценка качества дешевеет Источник: langchain.com, а сборка внутреннего агента у Toyota сжалась с месяцев до дней Источник: langchain.com.
Подорожало ровно одно: способность отвечать за результат, когда всё это работает нештатно. Двенадцать инцидентов за неделю — это цена, которую платит не поставщик, а тот, чей процесс на нём стоит Источник: status.claude.com. Ценным становится не доступ к возможности, а собственный ответ на вопрос «что мы делаем в те часы, когда её нет».
Как это читать
В этом выпуске три разных по весу типа утверждений, и их полезно различать.
Проверяемый факт — то, что можно открыть и пересчитать: записи в статус-лентах, доли попаданий с независимой лабораторной проверкой, результаты исследований с опубликованной методикой.
Заявление вендора — цифры, которые компания измерила сама на своём продукте: экономия на маршрутизации, удешевление оценки качества, ускорение инференса, показатели хранилища. Они не выдуманы, но и не проверены никем снаружи.
Прогноз — суммы экономии, названные в условном наклонении. В кейсе Toyota это сказано прямо, и именно поэтому мы приводим сокращение сроков, а не обещанные миллионы.
Голос сообщества показывает, что обсуждают, и не подтверждает ничего сам по себе.
Люди: работа и ответственность
По данным Anthropic, компания поставила Claude первым дежурным на сбои сборки: модель публикует первый разбор в пределах четверти часа и написала первую сводку в каждом недавнем инциденте, где такая сводка была. Но исправление приходит в виде запроса на изменение, который человек-дежурный читает, принимает и выкатывает сам.
Здесь и проходит новая граница профессии. Скорость первичного разбора больше не является вашим преимуществом — её отдали. Вашим преимуществом остаётся решение: принять или отклонить, выкатить или остановить, и объяснить потом, почему. Компания сама оговаривает, что модель не всегда права с первого раза и что результат разнится от команды к команде, — и это не мелкий шрифт, а описание вашей роли.
Отсюда практический навык на ближайший месяц: научиться быстро читать чужое предложение об исправлении и находить в нём то, что автор не проверил. Это уже не «умение пользоваться ИИ», это умение принимать решение по материалу, который вы не писали.
Бизнес: решение, экономика и риск
Для руководителя неделя дала редкий по чистоте материал: две компании публично, своими руками, задокументировали, как часто их сервис работает нештатно Источник: status.openai.com. Это готовые входные данные для расчёта, который обычно откладывают.
Считать надо не «сколько мы экономим на ИИ», а «сколько стоит час, когда его нет». Возьмите процесс, куда вы уже пустили модель, и оцените три величины: сколько людей останавливаются, есть ли ручной обход и сколько он занимает, и через какое время простоя вы обязаны сообщить клиенту. Частота инцидентов на этой неделе Источник: status.claude.com показывает, что случай не гипотетический. Пока этих трёх чисел нет, заявленная экономия на маршрутизации Источник: factory.ai — это не выгода, а несосчитанный риск.
Второй сюжет недели — где живёт выбор модели. Factory доказывает, что в обвязке Источник: factory.ai, Stripe соглашением о покупке OpenRouter голосует за шлюз Источник: stripe.com; сделка стала единственным ИИ-сюжетом недели, который разошёлся по независимым изданиям Источник: news.ycombinator.com. Рынок не определился, и это освобождает вас от необходимости угадывать: единственное решение, которое точно не устареет, — сохранить возможность сменить поставщика без переписывания процесса.
Доверие: границы, проверяемость и последствия
По данным Anthropic, компания открыла возможности своей самой сильной по кибербезопасности модели защитникам — и сразу сузила условия: сканирование доступно корпоративным клиентам, партнёры встраивают модель так, что пользователь получает конкретный результат вроде патча или предупреждения, а не прямой доступ к модели, и каждый патч обязан просмотреть и утвердить человек. На поддержку открытого кода выделены кредиты.
Здесь ограничение и есть содержание: та же способность, которая помогает защищающимся, делает опасной раздачу прямого доступа. Обратите внимание на конструкцию — «человек утверждает каждый патч» — это ровно то, чего не хватает большинству внутренних внедрений.
И рядом честная оговорка: работоспособность мер против злоупотребления утверждает сам вендор и его партнёры, независимого аудита нет. Кредиты — это обязательство поставщика собственным продуктом, а не деньги независимым исследователям.
То же правило приложите к своим агентам: доверие — не настройка модели, а ответ на четыре вопроса. Кто действует. По какому праву. Что остаётся в следах. Кто исправляет последствия и за чей счёт.
Рабочая карта недели
| Решение | Когда это ваш случай | Первый ход | Граница |
|---|---|---|---|
| Посчитать стоимость часа простоя, а не экономию | Модель уже стоит внутри процесса, от которого зависят люди или клиенты | Выписать три числа: кто останавливается, есть ли ручной обход, через какое время сообщаем клиенту | Пока обхода нет, любую экономию считайте авансом, а не результатом |
| Проверять модель на своих задачах, а не на публичной метрике | Выбираете модель или поставщика по опубликованным баллам | Собрать два десятка реальных случаев, которых нет в открытом доступе, и прогнать на них | Лидер публичного рейтинга может быть лидером именно по этому рейтингу |
| Держать смену поставщика настройкой, а не переписыванием | Выбираете, где размещать маршрутизацию моделей | Проверить, сколько кода придётся тронуть, чтобы завтра сменить провайдера | Если ответ «много», вы купили не скорость, а зависимость |
| Требовать утверждения человеком на необратимых действиях | Агент получает право менять данные, платить, отправлять или удалять | Составить список необратимых действий и закрыть их подтверждением | Право остановить процесс должно быть у человека, который отвечает за последствия |
Продолжить в Практикуме
- Контракт с агентом — зафиксируйте роль, доступы, границы, эскалацию, владельца и порог остановки до того, как агент получит право на необратимое действие.
- Эталонный набор — соберите свои случаи и проверяйте на них модель и внешнего оценщика, а не наоборот.
Следующий разумный ход
Откройте статус-страницу того поставщика, на котором держится ваш рабочий процесс, и посмотрите его ленту за последний месяц. Затем ответьте на один вопрос письменно: что именно делают ваши люди в те часы, когда сервис недоступен. Если ответа нет — это и есть задача недели, и она важнее любого нового запуска.
Уровень доверия и источники
- Лента инцидентов Claude — публичная статус-страница Anthropic; фиксирует объявленные инциденты, но не их тяжесть и длительность.
- Лента инцидентов OpenAI — публичная статус-страница OpenAI; пороги объявления инцидентов у разных компаний не совпадают, поэтому счёт между вендорами не сравнивается напрямую.
- Computer use, Skills API и Files API в общем доступе — объявление Anthropic; цифры клиентского кейса измерены вендором.
- Измерение подгонки под бенчмарк в распознавании речи — исследование с опубликованной методикой; охватывает два набора данных и одиннадцать моделей.
- Toyota North America о внутренних агентах — кейс, опубликованный поставщиком; суммы экономии заявлены как прогноз.
- Claude в проектировании белков и аналитической химии — отчёт вендора, но лабораторная проверка независимая; результаты не рецензированы.
- SIMA 2 и партнёрство со вселенной EVE — материал DeepMind; независимой оценки агента не приводится.
- Git в объектном хранилище — инженерный отчёт Cursor; показатели масштабирования получены на синтетических тестах.
- Маршрутизация моделей должна быть в обвязке — позиция и замеры Factory на собственном продукте; разброс по сессиям очень широк.
- Stripe покупает OpenRouter — объявление Stripe; финансовые условия не раскрыты, называемые в прессе суммы компанией не подтверждены.
- smolvm как песочница для недоверенного кода — практическая проверка одной версии, не аудит безопасности.
- Skala и предсказательные расчёты в химии — материал Microsoft Research; точность приводится на признанном эталоне, а не на произвольной химии.
- Управляемые оценщики LangSmith — объявление LangChain; экономия зависит от состава диалогов, доступность ограничена планами и регионом.
- Сколько памяти на самом деле нужно агенту — исследование IBM Research на одном наборе задач; влияние размера контекста не изолировано.
- Ускорение инференса LFM2.5-DSpark — замеры Liquid AI на собственных моделях; на большой модели прирост резко падает.
- Claude первым дежурным на сбоях сборки — внутренний инженерный отчёт Anthropic; доля инцидентов, закрытых без человека, не приводится.
- Mythos 5 для защитников — объявление Anthropic; работоспособность мер против злоупотребления независимо не проверялась.
- Реакция сообщества на сделку Stripe и OpenRouter — контекст обсуждения; внимание сообщества не подтверждает фактов.
Редакционная граница: Reddit Compass используется для обнаружения тем и контраста перспектив. Его community-сигналы не подтверждают факты без независимого первоисточника.