GPT-6.1 Sol: $0,56 за задачу в Agent Arena — AI-дайджест

GPT-6.1 Sol: $0,56 за задачу в Agent Arena — AI-дайджест

GPT-6.1 Sol вошла в Agent Arena на 5-е место при $0,56 за задачу, а Anthropic заняла три первых места. Hugging Face показала разрыв 62% против 33% между харнесами.

Главное сегодня

GPT-6.1 Sol стоит $0,56 за задачу в Agent Arena, а Anthropic заняла все три первых места

GPT-6.1 Sol от OpenAI вошла в рейтинг Agent Arena на 5-е место с медианной стоимостью $0,56 за задачу, а модели Anthropic заняли первые три строчки. Данные опубликовала Arena: Sol в режиме Max на 39% дешевле GPT-6 Sol при результате на 1,52 пункта выше и на 81% дешевле GPT-6 Astra при отставании всего на 1,04 пункта. Claude Sonnet 5.5 в режиме Max дебютировала на 3-м месте и стала первой в категории Chat, но стоит $2,74 за задачу против $1,58 у Opus 5.5 на 2-м месте — поэтому, по оценке Arena, на границу «цена — качество» Sonnet 5.5 не попадает. Цена GPT-6.1 Sol — $2/$10 за миллион входных и выходных токенов против $10/$50 у Astra, сообщает DL Weekly. В WebDev Arena Sol ненадолго поднялась на 3-е место, но Sonnet 5.5 сдвинула её на 4-е, а Gemini 4 Argon в режиме High заняла 1-е место в Text Arena, говорится в недельной сводке Arena.

Hugging Face: одни и те же веса дают 62% в одном харнесе и 33% в другом

Hugging Face показала, что результат модели сильно зависит от харнеса: одни и те же веса набрали 62% в одной обвязке и 33% в другой. Харнес — это программная обвязка агента вокруг модели: цикл вызовов, набор инструментов, формат подсказок и правила работы с контекстом. Hugging Face выпустила метод обучения с подкреплением сразу в нескольких харнесах: прокси-сервер говорит на форматах API OpenAI, Anthropic и Gemini и записывает идентификаторы токенов и логарифмы вероятностей для обучения, не меняя сами харнесы. Модель LFM2.5-2.6B после такого обучения выросла с 42% до 54% в среднем по четырём харнесам и стала делать на 31% меньше вызовов инструментов. Для сравнения, обычное дообучение (SFT) на 3 189 прогонах Qwen3.8-27B упёрлось в потолок 47,5%. Hugging Face открыла тренер, данные и все семь обученных моделей — тему открытых весов подробно разбирает наш гид по open-source LLM.

Pi 1.0 включила MCP по умолчанию, а DeepSeek, Anthropic и T3 Code выпустили свои харнесы

Earendil выпустила стабильную Pi 1.0 — минималистичный харнес для агентов с поддержкой MCP «из коробки» в режиме Codemode. По анонсу Earendil, в релиз также вошли отложенная загрузка инструментов, прогрев кэша для моделей Anthropic и системные сообщения посреди диалога; экспериментальная Pi Durable работает на Cloudflare Durable Objects через agents SDK v0.26.0. DeepSeek Harness получил настольные сборки для macOS и Windows. В Claude Code появились моды — плагины с хуками по принципу middleware; как устроены расширения Claude Code, объясняет наш гид по скиллам Claude Code. Оркестратор T3 Code перешагнул 400 тысяч пользователей, а его переписанная версия — 823 коммита в 1 912 файлах — влилась в основную ветку. Эльвис Саравиа называет эту волну переходом к «пластичным» харнесам. Готовые сценарии с агентами для n8n и Make — в каталоге шаблонов автоматизаций AI SKILLS.

Модели решений пришли в llama.cpp, Cloudflare выпустила открытую Clef

llama.cpp добавила эндпоинт /v1/systemone для локального запуска моделей решений. Модель решений — это модель, которая не пишет свободный текст, а выбирает один вариант из заданного списка: действие, класс или продолжение. Об эндпоинте сообщил Георгий Герганов, а Клеман Деланг показал запуск одной командой llama serve -hf ggml-org/Kev-4B-GGUF. Cloudflare выпустила открытую модель решений Clef, дообученную из Qwen3.8-27B, и облегчённую clef-flash на базе Qwen3.5-9B; модели Clef уже доступны в Ollama. Perplexity заявляет, что pplx-decider-v1-27b набирает в среднем 85,7% на 11 бенчмарках. Скептики не согласны с новизной: Мерве Нойан называет модели решений ребрендингом zero-shot классификаторов.

Meta выпустила шесть математических статей, написанных с Muse Spark в обычном чате

Meta опубликовала шесть статей по открытым математическим задачам, полученных с помощью Muse Spark 1.1 и 1.2 в обычном чате meta.ai без специальной обвязки. Об этом сообщила AI at Meta, список работ привёл Александр Ванг. В каждой статье помечено, какие фрагменты написали в основном люди, а какие — ИИ, и работы проверила вторая группа математиков. Параллельно Google представила мультиагентную систему Cogentic на базе Gemini, которая получила новые результаты по пяти открытым теоретическим задачам: каждый черновик проходит двух состязательных проверяющих, а агенты ведут общий журнал проверенных лемм. Большинство задач Cogentic потребовали около 100 вызовов модели, самая сложная — около 1 000.

Цифры и факты

Сводная таблица AI SKILLS: стоимость задачи в Agent Arena на 2 октября 2026 года. Цены за задачу GPT-6 Sol и GPT-6 Astra — наш расчёт из процентов, которые опубликовала Arena; остальные цифры — данные Arena и DL Weekly.

МодельМесто в Agent ArenaЦена за задачуЦена за 1M токенов (вход/выход)
Claude Opus 5.52$1,58—
Claude Sonnet 5.5 [Max]3$2,74—
GPT-6.1 Sol [Max]5$0,56$2/$10
GPT-6 Sol—≈$0,92 (расчёт)—
GPT-6 Astra—≈$2,95 (расчёт)$10/$50

Разные точки зрения: стала ли Claude Opus 5.5 хуже после запуска?

В начале октября 2026 года пользователи Reddit массово жалуются на падение качества Claude Opus 5.5, а трекер настроений modelsentiment.com зафиксировал снижение оценки модели с 71–73 до 55 из 100. При этом ни один из жалующихся не привёл воспроизводимого замера, а независимые рейтинги на этой же неделе держат Opus 5.5 на 2-м месте Agent Arena.

Инструменты и приёмы

Коротко