У Beam от Reflection AI 501 млрд параметров. Для обработки каждого токена модель активирует 23 млрд. Компания делает ставку на эффективность: по её оценке, Beam сопоставима с GLM 5.2 на сложных рассуждениях и тратит в 3–4 раза меньше вычислений. Пока это заявление самой Reflection. Веса ещё не опубликованы.

Анонс вышел 5 октября. Beam — первая open-weight модель Reflection AI. Её нацелили на кодинг, рассуждения и работу AI-агентов. Это текстовая модель для задач, где нужно писать код, пользоваться инструментами и выполнять несколько шагов до ответа.

График сравнивает Beam с другими моделями по эффективности рассуждений и вычислениям на попытку.Источник: reflection.ai

Как устроена модель Beam

Beam использует разреженную архитектуру MoE — Mixture of Experts, или «смесь экспертов». Внутри модели есть разные специалисты. Для обработки конкретного токена включается только часть из них. Всего в Beam 501 млрд параметров, на один токен активны 23 млрд.

Рисунок 5: Оценки DeepSWE на части RL-запуска. Каждая точка — отдельное усилие рассуждения. Фронт Парето сначала сжимается по мере обучения политики эффективности токенов, затем расширяется для достижИсточник: reflection.ai

Эти 23 млрд не означают, что модель запустится на обычном ноутбуке. Активные параметры показывают объём вычислений на шаге генерации. Они не говорят, сколько места займут все веса и какое железо потребуется для запуска. Требования к памяти станут понятнее после публикации технического отчёта.

Reflection сообщает, что обучала Beam на 23,8 трлн токенов из открытых материалов и лицензированных наборов данных. В обучающую смесь вошли код, технические тексты, математика и научные материалы. Компания также описала очистку данных. По её словам, около 95% интернет-токенов отсеяли при разборе, удалении дублей и оценке качества.

Ещё один большой этап — обучение с подкреплением. Reflection говорит, что за четыре недели провела более 100 млн тренировочных прогонов на 10 500 GPU NVIDIA GB300. Контекст одного прогона доходил до 256 тысяч токенов. Масштаб внушительный, но эти цифры сами по себе не показывают, как модель справится с вашей задачей.

Что известно о сравнении Beam и GLM 5.2

По словам Reflection, на сложных задачах рассуждения Beam показывает результат, сопоставимый с GLM 5.2, и использует в 3–4 раза меньше вычислений на этапе инференса. Инференс — это момент, когда обученная модель отвечает на запрос. Для компании, которая сама обслуживает модель, экономия вычислений может снизить нагрузку и стоимость работы.

Преимущество пока никто независимо не подтвердил. RuntimeWire также отмечает, что в опубликованной оценке вычислений не учли часть затрат на обслуживание модели. А в области максимальных возможностей сама Reflection признаёт преимущество Kimi K3.

Beam пока не называют безусловным лидером. Reflection предлагает сравнить не только качество моделей, но и затраты на их работу. Если качество близко, а вычислений требуется меньше, Beam может подойти для постоянных кодовых и агентных задач.

Reflection AI описывает цель Beam как эффективные рассуждения при меньших вычислительных затратах.

В Beam можно будет задавать уровень reasoning effort — интенсивность рассуждений. На низком уровне модель должна давать более короткие ответы, на высоком — тратить больше токенов на сложные задачи. Reflection предлагает так регулировать баланс между вычислительными затратами и качеством. На практике его ещё предстоит проверить на своих сценариях.

Как применить Beam для работы креатора

Пока запустить Beam самостоятельно нельзя: веса ещё не опубликованы. Reflection обещает выложить их в течение месяца вместе с техническим отчётом, карточкой модели и инструментами для разработчиков. Заявленная лицензия — Apache 2.0. Сейчас компания завершает проверки безопасности и принимает заявки на ранний доступ.

Когда модель выйдет, я бы начал с рутины, где цена ошибки понятна. Например, попросил бы её разобрать структуру исходников, написать черновой скрипт для сборки версий, подготовить SQL-запрос к метрикам или помочь агенту пройти последовательность действий в терминале. В креативной студии Beam может пригодиться за кадром — для автоматизации части производства. Сам визуал она не генерирует.

Для первого теста я бы взял пару одинаковых задач и записывал качество ответа, число токенов, время, количество исправлений и стабильность результата. Иначе обещание тратить в три раза меньше вычислений останется красивой цифрой. Ещё нужно проверить, сколько ресурсов займут хранение и запуск всех весов: число активных параметров этого не объясняет.

Главный тест для Beam ещё впереди

В анонсе важны открытые веса и возможность изучать модель, адаптировать её и запускать в собственных системах. Если заявленная эффективность подтвердится, это пригодится разработчикам. Перед внедрением всё равно придётся изучить технические требования: одной лицензии Apache 2.0 недостаточно.

Независимый обзор Ridge приводит предварительную оценку Artificial Analysis: ранние тесты указывали на высокую токенную эффективность Beam для её уровня. Это пока предварительный сигнал. Полного сравнения ещё нет. Ждём веса, подробную методику и внешние тесты — по ним станет яснее, даёт ли модель экономию в реальной работе.

Пока Beam выглядит как гипотеза для проверки: сможет ли модель решать рабочие задачи и при этом тратить меньше вычислений на каждый цикл.

Источники

Introducing Beam: Reflection's 501B open-weight model

Reflection publishes Beam benchmark scores ahead of its weight release

Reflection's Beam is a serious American open model. It is not the best one yet.

Источникaitimes.kr