Reflection выпустила открытую модель Beam для программирования и ИИ-агентов
Модель с 501 млрд параметров активирует 23 млрд на каждый токен. Reflection утверждает, что на некоторых задачах Beam сопоставима с конкурентами при меньших вычислительных затратах; веса и документация должны появиться позднее.
Модель пока доступна избранным пользователям
Компания Reflection объявила о выпуске Beam — своей первой модели, которую она планирует сделать свободно доступной. Сейчас Beam проходит финальное тестирование безопасности, а ранняя версия предоставлена отдельным пользователям. Технический отчёт, документацию для разработчиков и веса модели под лицензией Apache 2.0 компания обещает выпустить «позднее в этом месяце».
Beam предназначена для программирования, логических рассуждений и задач с ИИ-агентами. Это модель типа «смесь экспертов»: при общем размере 501 млрд параметров она активирует 23 млрд параметров на токен. Reflection позиционирует её как вариант для компаний, которым нужны автоматизация и кодирование с контролем вычислительных расходов.
Reflection заявляет о сопоставимых результатах при меньших затратах
По данным Reflection, на сложных задачах рассуждения Beam показывает результаты на уровне GLM 5.2, используя в три-четыре раза меньше вычислительных ресурсов. На тестах программирования и ИИ-агентов она, по заявлению компании, приближается к более крупной Qwen3.8-Max. При этом Reflection признаёт, что Kimi K3 превосходит Beam по максимальной производительности.
В опубликованной таблице результатов для Terminal Bench 2.1 у Beam указано 80,1 балла, у GLM 5.2 — 81,0, у Qwen 3.8 Max — 86,6, а у Kimi K3 — 88,3. Это приведённые в источнике результаты тестирования, а не независимая оценка качества моделей. Reflection также сообщила, что уже обучает следующую модель, которая должна сократить разрыв с сильнейшими открытыми моделями.
Результаты Terminal Bench 2.1, приведённые Reflection| Модель | Результат |
|---|
| Beam | 80,1 |
| GLM 5.2 | 81,0 |
| Qwen 3.8 Max | 86,6 |
| Kimi K3 | 88,3 |
Обучение включало более 80 млн циклов подкрепления
По словам Reflection, возможности Beam сформировались благодаря предварительному обучению и масштабному этапу обучения с подкреплением. Для него компания использовала 10 500 ускорителей Nvidia GB300 более четырёх недель. Reflection назвала этот запуск одним из крупнейших тренировочных процессов среди открытых лабораторий и сообщила, что результаты продолжали улучшаться к его завершению.
Компания приводит графики, на которых показатели Beam растут по мере увеличения числа циклов обучения и превышают 80 млн без видимого плато. Пользователь может настраивать глубину рассуждений модели: быстрый ответ требует меньше вычислений, а более длительная обработка сложной задачи может повысить качество результата.
Reflection также сообщила о способности, которую называет возникающей: во время обучения на задачах рассуждения, разработки программ и работы в терминале Beam стала лучше выполнять поиск в интернете, хотя такие задачи не входили в тренировочную смесь. При доступе к сети модель научилась обращаться к другим языковым моделям и получать документы из внешних сервисов. Beam работает с текстом; материалы других форматов, по утверждению компании, она может обрабатывать, если представить их в текстовом виде.
Для безопасности Reflection объединила Beam со второй моделью
Для настройки безопасности и поведения Reflection обучила отдельную модель и объединила её с Beam. Правила включают запреты, требования к точности и признанию неопределённости, а также ориентиры для прямых и подробных ответов. Компания намерена опубликовать результаты проверок безопасности и открыть разработанные методы оценки.
Reflection основана в 2024 году бывшими исследователями Google DeepMind Мишей Ласкиным и Иоаннисом Антоноглу. В октябре 2025 года стартап привлёк 2 млрд долларов при оценке в 8 млрд долларов. Компания публикует веса своих моделей, но оставляет данные и процессы обучения закрытыми.
The Decoder — Reflection's Beam becomes the most capable open-weight model built outside China