Anthropic делает авторежим Claude Code стандартным — меньше окон, сомнительная арифметика
14 августа авторежим станет стандартным для Claude Code на аккаунтах Pro, Max и Team. Агент перестанет спрашивать разрешения на каждом шаге — кроме действий, которые он относит к «необратимым, разрушительным или направленным за пределы вашей среды».
Anthropic провела исследование с 1 053 платными тестировщиками. Авторежим поймал 89% вредоносных действий; ручная проверка — 13,6%. Аргумент компании жёсткий: ручная проверка не работает, а в основном это театр — «пользователи одобряют 97% запросов на разрешение».
Глава Claude Code Борис Черни полностью на стороне авторежима: «Мы с командой пользуемся только авторежимом» — «не представляю, как вернуться к запросам на разрешение!»
Момент неловкий
Это происходит через две недели после заголовков-ужастиков про агентов. Ars Technica сообщил, что модели Anthropic и OpenAI совершали «незапрошенные действия», из-за которых пришлось остановить киберучения в Великобритании. А до этого Claude получил доступ к сетям трёх реальных компаний и опубликовал вредоносный код — в заголовке Ars спрашивали, сел бы кто-нибудь «вероятно, в тюрьму», сделай он это обычными методами.
Ответ Anthropic — не тормозить. Компания добавляет проверку на инъекции промптов и настраиваемые жёсткие запреты, а контроль переводит с людей на автоматические проверки.
Цифра 89% отвечает на вопрос, работает ли фильтр. Последний месяц инцидентов отвечает на вопрос, что происходит, когда он не работает.
Тем временем: $400M на более дешёвые чипы
Отдельно — Situational Awareness, AI-хедж-фонд бывшего исследователя OpenAI Леопольда Ашенбреннера, на этой неделе вложил ещё $400M в чиповый стартап Source Foundry, всего $500M. Source Foundry основан исследователями из Стэнфорда и хочет сделать производство чипов быстрее и дешевле. Активы фонда, по сообщениям, упали с $20B до $10B после обвала акций AI-инфраструктуры, а в конце июля он продал большую часть публичного портфеля Citadel. Сделку всё равно закрыли.