Reflection Beam: 501B под Apache 2.0 — AI-дайджест

Reflection Beam: 501B под Apache 2.0 — AI-дайджест

Reflection AI выпустила Beam на 501 млрд параметров с весами под Apache 2.0, SemiAnalysis насчитала у подписок Claude в 5 с лишним раз больше ценности, чем у OpenAI, а OpenAI вводит водяные знаки в тексты ChatGPT для ЕС.

Главное сегодня

Reflection Beam: 501 млрд параметров, 80,9 на SWE-bench Verified и веса под Apache 2.0

Reflection AI представила Beam — текстовую модель на 501 млрд параметров, из которых на каждый токен работают 23 млрд, для кода, агентных и научных задач; полные веса под лицензией Apache 2.0 обещаны в октябре 2026 года. Об этом говорят анонс компании и пост Миши Ласкина. Смесь экспертов (MoE) — это архитектура, в которой на каждый токен включается лишь часть весов, поэтому 501 млрд параметров по вычислениям обходятся как 23 млрд. Beam обучена с нуля на 23,8 трлн токенов, часть из которых получена распознаванием сотен миллионов PDF, — по словам руководителя данных. Обучение с подкреплением шло на 10 тыс. ускорителей GB300: больше 100 млн прогонов примерно на 1 млн задач. Технический отчёт и интеграции с открытыми инструментами обещаны отдельно. Как запускать открытые веса у себя — в нашем гиде по open-source LLM.

Reflection Beam в цифрах: заявки компании и цена вычислений

Сводка заявлений Reflection даёт Beam 80,9 балла на SWE-bench Verified и эффективность инференса в 3–4 раза выше, чем у GLM 5.2, при четырёх неделях предобучения и четырёх неделях обучения с подкреплением на ~10 500 GB300 (сводка). Все эти цифры — данные самой компании, независимых замеров пока нет. Axios заранее сообщил о запуске и о затратах: Reflection платит $150 млн в месяц за вычисления на Colossus и заключила сделку с Nebius на $1 млрд; по тем же данным, другие американские лаборатории тоже выпустят открытые модели в октябре 2026 года (Эндрю Карран). The AI Daily Brief 6 октября 2026 года поставил выход Beam первой новостью выпуска (эпизод). Готовые открытые инструменты собраны в разделе Open Source на AI SKILLS.

Подписки на ИИ: Claude даёт в 5+ раз больше ценности, чем планы OpenAI, — замер SemiAnalysis

SemiAnalysis сравнила подписки Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Cursor, Cognition и других и пришла к выводу, что тарифы Claude дают в 5 с лишним раз больше ценности в пересчёте на цены API, чем планы OpenAI. Ценность в методике SemiAnalysis считается по стоимости кредитов для каждой модели и типа токенов, а не по прайсу API. С поправкой на стоимость одной задачи преимущество Claude сжимается до 1,3–2,9 раза. Непроверенная оценка одного аналитика: Anthropic тратит 42% вычислений инференса на подписки, которые приносят ~10% выручки. Параллельно The Information сообщает, что Microsoft урезала плановые внутренние расходы на Anthropic больше чем на треть, а число пользователей Claude Code в Meta упало примерно с 60 тыс. до 30 тыс. — в основном из-за перехода на собственные инструменты Meta (сводка).

Codex: OpenAI обещает улучшение каждый день 28 дней и ускорила GPT-6 Astra на ~50%

Руководитель Codex Тибо пообещал заметное улучшение или полный сброс лимитов каждый день в течение 28 дней — пост собрал 30,9 тыс. реакций. Повод — жалобы пользователей: по их сообщениям, новые подписки за $200 были приостановлены, а лимиты на всех тарифах фактически урезаны вдвое; GPT-6.1 Sol подавалась как экономичная альтернатива. Первым днём стало ускорение: скорость GPT-6 Astra и GPT-6.1 Sol по умолчанию выросла примерно на 50%, с ~30 до ~50 токенов в секунду, на всех подписках и у партнёров входа через ChatGPT — OpenCode, Pi, Amp и Devin. Шероховатости остаются: накопленные сбросы Codex сгорают без учёта часового пояса, а постоянно работающий агент Dots доступен только на тарифах Pro от $100.

ИИ-безопасность: OpenAI вводит водяные знаки в тексты ChatGPT и Codex в ЕС

OpenAI добавит невидимые статистические водяные знаки в подходящие тексты ChatGPT и Codex для пользователей ЕС по требованиям AI Act, а в API по всему миру появится переключатель для включения по желанию. Водяной знак в тексте — это незаметный статистический узор в выборе слов модели, по которому специальный детектор потом узнаёт сгенерированный текст. Ограничения компания называет сама: пересказ или перевод знак стирают, а детектор получат только одобренные исследователи. Критики приводят тест, в котором замена 25% слов синонимами снижает обнаружение примерно с 92% до 17%. На фоне громких инцидентов с агентами Йошуа Бенджио в колонке для FT доказывает, что недавние взломы агентами — не просто проблема песочниц, а Нил Нанда назвал инцидент OpenAI и Hugging Face самым заметным провалом выравнивания на сегодня.

Hugging Face: 10 агентских харнесов стали средами обучения с подкреплением

Hugging Face превратила 10 немодифицированных агентских харнесов в среды обучения с подкреплением через прокси, который понимает форматы OpenAI Chat, OpenAI Responses, Anthropic и Gemini и записывает точные идентификаторы токенов и логарифмы вероятностей для TRL. Харнес — это обвязка вокруг модели: цикл, инструменты и формат вызовов, в которых агент выполняет задачу. Эксперимент показал, насколько обвязка важна: одни и те же веса набирают 62% в Mini-SWE-Agent и 33% в Claude Code. Обучение LFM2.5-2.6B сразу на 4 харнесах подняло долю задач, решённых с первой попытки, с 42% до 54%, а бонус за вызов инструментов сократил число вызовов на 31%; обычное дообучение на 3189 прогонах упирается в 47,5%. Оговорка авторов: один тип задач и одно зерно генератора. Сами среды теперь хранятся и версионируются на Hugging Face Hub, как датасеты. Готовые агентские сценарии — в шаблонах автоматизаций AI SKILLS.

Цифры и факты

Сводная таблица AI SKILLS: открытые веса и новые модели, неделя 3–5 октября 2026 года

МодельПараметрыЛицензия и доступЗаявленный результатИсточник
Reflection Beam501B всего / 23B активных, MoE, только текстApache 2.0, веса в октябре 202680,9 SWE-bench VerifiedReflection
Aleph Alpha Kolibri78B всего / 3,46B активныхApache 2.0, немецкий и английский96,9% AIME 2025, 84,3% GPQA Diamond, 66,4% SWE-Bench Verifiedсводка
Reka Rho-119B, омни: текст, изображения, видео, действия роботов—обучена с нуля на 320 H100 за ~3 месяцаReka
Upstage Solar Mini 435B всего / 3B активных, контекст 512Kбесплатно на Nous Portal две недели—Nous
Command Code Agr / Agr-flash31B / 360M, без генерации текста—возвращают типизированные значения с вероятностями для вызовов инструментов и маршрутизацииCommand Code

Все результаты в таблице — данные разработчиков. У Kolibri датасет не раскрыт, а агентные оценки заметно ниже, чем у Qwen.

Разные точки зрения: Reflection Beam — прорыв американских открытых весов или повтор DeepSeek V3?

Reflection Beam — это 501 млрд параметров, 23 млрд активных, 80,9 на SWE-bench Verified по собственным данным и веса под Apache 2.0. Американских открытых моделей такого размера мало, поэтому спор идёт не о факте выпуска, а о том, догоняет ли Beam китайских лидеров.

За. Artificial Analysis, получившая ранний доступ, ожидает, что Beam окажется среди самых экономных по токенам открытых моделей для своего уровня интеллекта. Эли Бакуш отмечает, что на отложенном коде у Beam перплексия лучше, чем у DeepSeek V4.

Нейтрально. Натан Ламберт ставит Beam в один ряд с моделями Nvidia и Thinking Machines как сильные американские релизы, которые всё же отстают от китайских. Наблюдатели помещают Beam примерно на уровень GLM-5.2.

Против. Teortaxes называет Beam повторением DeepSeek V3 при том же бюджете вычислений и оценивает около 1,3 млрд RL-песочниц за 4 недели. На части бенчмарков Beam уступает DeepSeek V4 Flash, а Бакуш оценивает загрузку ускорителей при предобучении всего в ~12%. Ещё до анонса в r/LocalLLaMA напоминали историю Reflection 70B и сомневались, что компания вообще выпустит веса.

Инструменты и приёмы

Коротко