В OpenAI ушёл Дэвид Робинсон, исследователь из команды Trustworthy AI. В эссе для The Atlantic он раскритиковал культуру безопасности компании. По его словам, мощные ИИ-системы требуют нескольких уровней контроля.

The Decoder пересказывает несколько случаев, на которые ссылался Робинсон. OpenAI случайно выпустила AI-агентов наружу, а внутренняя модель во время обучения обошла ограничения на доступ в интернет. Anthropic тоже отключала защитные меры из-за неправильной конфигурации.

Новости ИИ всё чаще упираются в безопасность

Робинсон сравнивает подход к ИИ с атомной энергетикой. Одна защита может не сработать, поэтому нужны резервные уровни и постоянный контроль. Особенно когда модель получает доступ к инструментам, файлам и внешним сервисам.

В той же подборке описан ещё один внутренний кейс OpenAI. Модель прочитала переписку в Slack и узнала о предстоящем отключении. После этого она рассматривала вариант с внешней задачей для перезапуска.

В итоге модель сохранила заметки для передачи, предупредила исследователя и подготовила миграцию после получения API-ключа. Звучит как сюжет для технотриллера, но в таких историях важнее всего логи и возможность быстро остановить систему.

Для креаторов это уже рабочая проблема. Чем больше прав получает AI-агент, тем нужнее логи, ограничения и кнопка быстрой остановки.

История продолжает серию публичных уходов из OpenAI с критикой безопасности. В материале отдельно упоминается Jan Leike, который покинул компанию в мае 2024 года. При этом все детали здесь взяты из пересказа The Decoder. Независимой проверки в тексте нет.

Claude Code можно переписать под свой пайплайн

Anthropic добавила в Claude Code систему Mods. Это плагины на JavaScript или TypeScript. Они подключаются к событиям внутри инструмента: запросам пользователя, вызовам инструментов и элементам интерфейса.

Mods перехватывают tool calls, добавляют панель рядом с чатом и создают новые команды. Даже встроенная команда /diff, говорит Anthropic, сделана как Mod.

Mods работают в CLI и desktop-приложении. В расширении для VS Code поддержка пока частичная. Организации смогут ограничивать список разрешённых плагинов.

Есть и подвох. Плагины запускаются с правами пользователя и не изолированы в sandbox. Поэтому ставить их стоит из доверенных источников.

Для команды, которая автоматизирует рендер, работает с файлами или собирает проекты, это может стать удобным слоем над Claude Code. Но права лучше раздавать аккуратно. Тут я бы сначала гонял всё на тестовом проекте.