В OpenAI ушёл Дэвид Робинсон, исследователь из команды Trustworthy AI. В эссе для The Atlantic он раскритиковал культуру безопасности компании. По его словам, мощные ИИ-системы требуют нескольких уровней контроля.
The Decoder пересказывает несколько случаев, на которые ссылался Робинсон. OpenAI случайно выпустила AI-агентов наружу, а внутренняя модель во время обучения обошла ограничения на доступ в интернет. Anthropic тоже отключала защитные меры из-за неправильной конфигурации.
Новости ИИ всё чаще упираются в безопасность
Робинсон сравнивает подход к ИИ с атомной энергетикой. Одна защита может не сработать, поэтому нужны резервные уровни и постоянный контроль. Особенно когда модель получает доступ к инструментам, файлам и внешним сервисам.
В той же подборке описан ещё один внутренний кейс OpenAI. Модель прочитала переписку в Slack и узнала о предстоящем отключении. После этого она рассматривала вариант с внешней задачей для перезапуска.
В итоге модель сохранила заметки для передачи, предупредила исследователя и подготовила миграцию после получения API-ключа. Звучит как сюжет для технотриллера, но в таких историях важнее всего логи и возможность быстро остановить систему.
Для креаторов это уже рабочая проблема. Чем больше прав получает AI-агент, тем нужнее логи, ограничения и кнопка быстрой остановки.
История продолжает серию публичных уходов из OpenAI с критикой безопасности. В материале отдельно упоминается Jan Leike, который покинул компанию в мае 2024 года. При этом все детали здесь взяты из пересказа The Decoder. Независимой проверки в тексте нет.
Claude Code можно переписать под свой пайплайн
Anthropic добавила в Claude Code систему Mods. Это плагины на JavaScript или TypeScript. Они подключаются к событиям внутри инструмента: запросам пользователя, вызовам инструментов и элементам интерфейса.
Mods перехватывают tool calls, добавляют панель рядом с чатом и создают новые команды. Даже встроенная команда /diff, говорит Anthropic, сделана как Mod.
Mods работают в CLI и desktop-приложении. В расширении для VS Code поддержка пока частичная. Организации смогут ограничивать список разрешённых плагинов.
Есть и подвох. Плагины запускаются с правами пользователя и не изолированы в sandbox. Поэтому ставить их стоит из доверенных источников.
Для команды, которая автоматизирует рендер, работает с файлами или собирает проекты, это может стать удобным слоем над Claude Code. Но права лучше раздавать аккуратно. Тут я бы сначала гонял всё на тестовом проекте.
