Opus 5.5: 66 баллов в кодинге и $13 за задачу — AI-дайджест

Claude Opus 5.5 возглавил Coding Agent Index с 66 баллами, но задача стоит $13,04; GPT-6 Luna даёт 37 баллов по $0,068, а Meta показала VR-очки за $1299.
Главное сегодня
Opus 5.5 возглавил Coding Agent Index с 66 баллами, но задача обходится в $13,04
Claude Opus 5.5 занял первое место в Coding Agent Index от Artificial Analysis с 66 баллами против 60 у Opus 5, но одна задача индекса стоит $13,04. Coding Agent Index — это сводный балл модели по нескольким бенчмаркам задач кодинг-агента. По данным Artificial Analysis, Opus 5.5 набрал 63,1% на Terminal-Bench 4.0, 68,4% на DeepSWE v1.1 и 66,4% на SWE-Atlas-QnA. Цена токенов снизилась до $4/$20 за миллион входных и выходных токенов, чтение из кэша — $0,20. Задача при этом дорожает: Opus 5.5 тратит на неё 15,6 млн токенов, а выходных токенов расходует более чем вдвое больше. Отдельно модель поставила рекорд 2631 Elo в бенчмарке письма с отрывом в 307 пунктов, но прогон на максимальном усилии занимает 17 минут и $3,43 на один сценарий. Готовые скиллы для кодинг-агентов собраны в гиде по скиллам Claude Code.
Дешёвый край рынка: GPT-6 Luna даёт 37 баллов по $0,068 за задачу
На нижнем краю кривой «цена — качество» Artificial Analysis стоят GPT-6 Luna с 37 баллами Intelligence Index по $0,068 за задачу, MiMo-V2.6-Pro с 46 баллами по $0,13 и GPT-6 Sol с 48 баллами по $1,06. Opus 5.5 в том же замере Artificial Analysis набирает 58 баллов. Граница Парето — это набор моделей, у которых нельзя получить больше баллов, не заплатив дороже. Независимая площадка Vals оценивает GPT-6 Luna в $0,10/$0,50 за миллион токенов: это примерно в 100 раз дешевле GPT-6 Astra за токен при отставании в пределах 8 пунктов по Vals Index. У GPT-6 Luna окно контекста 1 млн токенов и до 128 тыс. токенов ответа. Тот же сдвиг виден в компаниях: по словам @Yuchenj_UW, инженеры Databricks перестали тянуться к закрытым моделям, когда внутренние кодинг-агенты начали маршрутизировать задачи на открытые. Как запускать открытые модели у себя — в гиде по open-source LLM.
Meta Connect 2026: VR-очки за $1299, слуховой аппарат с одобрением FDA и покупка WaveForms
Meta показала на Connect 2026 свои первые VR-очки вместо шлема по цене $1299, а очки компании получили функцию слухового аппарата с одобрением FDA. По анонсу Марка Цукерберга, VR-очки Meta позиционируются как частный кинотеатр, рабочее место с несколькими мониторами и игровая консоль; цену $1299 назвал @kimmonismus. Очки превратили в слуховой аппарат, одобренный FDA. Ray-Ban Meta Gen 3 получили более долгую батарею, улучшенные микрофоны и новые формы оправ, включая «авиаторы». Meta также купила WaveForms AI — стартап Алексиса Конно в области речи и звука, чьи наработки уже появились на Connect. Новую фронтирную модель Meta пока только пообещала: Александр Ван сказал, что «самая способная модель, которую мы когда-либо обучали» выйдет совсем скоро.
Цифры и факты
- 100 тыс.+ H100-часов ушло на сборку OpenRSI-Index v0.1; индекс гоняет траектории автономного исследования длиной больше 60 часов на кластерах из 1000 GPU.
- Четыре эффективные архитектуры сравнил @eliebakouch: DeepSeek V4.1 Flash и MiMo V3 используют YOCO, Qwen 3.8 Next Flash и GLM 5.3 Flash чередуют разреженное и линейное внимание в пропорции 3:1.
- 1K–10K токенов — диапазон контекста, в котором Jev стал самой популярной моделью на OpenRouter.
Сводная таблица AI SKILLS: цена задачи и баллы Intelligence Index, сентябрь 2026 года
| Модель | Intelligence Index | Цена задачи |
|---|---|---|
| GPT-6 Luna | 37 | $0,068 |
| MiMo-V2.6-Pro | 46 | $0,13 |
| GPT-6 Sol | 48 | $1,06 |
| Claude Opus 5.5 | 58 | $5,98 |
Таблицу собрала редакция по замеру Artificial Analysis. Переход от GPT-6 Sol к Opus 5.5 даёт +10 баллов при росте цены задачи в 5,6 раза.
Разные точки зрения: нужен ли миру глобальный регулятор ИИ?
Спор о регулировании ИИ в сентябре 2026 года раскололся на три лагеря: срочные глобальные меры, отказ от мирового регулятора и «умеренные», которые не выбирают между оптимизмом и катастрофой. Выпуск The AI Daily Brief от 27 сентября 2026 года «The Rise of the AI Moderates» описывает, как всё больше голосов отказываются от выбора между безоглядным оптимизмом и неизбежной гибелью.
За срочные меры. Йошуа Бенжио на заседании Совбеза ООН призвал действовать немедленно.
Нейтрально. Ведущий The AI Daily Brief опирается на эссе Фрэнсиса Фукуямы о том, почему он пересмотрел взгляд на риски ИИ, на подход «ИИ как обычная технология» и на пост Джеффри Катценберга; разговор идёт о рисках ИИ, человеческом творчестве и о том, кто решает, каким будет ИИ.
Против глобального регулятора. Кратсиос отверг идею мирового регулятора ИИ.
Инструменты и приёмы
- Попробуйте Jev в роли реранкера. В поисковой базе turbopuffer встроенное переранжирование уже поддерживает Jev — модель, которая возвращает готовое решение с вероятностью вместо рассуждений. Шаблоны RAG-сценариев — в каталоге автоматизаций AI SKILLS.
- Проверьте инструменты интерпретируемости на WorkspaceBench. Нил Нанда представил бенчмарк для оценки таких инструментов.
- Разберитесь, откуда взялся GRPO. @cwolferesearch прослеживает путь обучения с подкреплением от VPG через REINFORCE и PPO к GRPO и его вариантам — удобная карта перед чтением свежих статей по RL.
Коротко
- Gemini 4, по сведениям @kimmonismus, почти закончила обучение.
- Redwood Research предупреждает, что рассуждения моделей в скрытом «нейроязыке» подорвут надзор через цепочку рассуждений.
- Joby заявила о первом полностью автономном перелёте через США, пишет Superhuman AI 27 сентября 2026 года.