Kimi K3 в топе бенчмарка LLM для агентов
В чат переслали заметку из канала «LLM под капотом»: по их бенчмарку Kimi K3 сравнима с GPT-5.5 Pro по очкам, примерно в 15 раз дешевле и примерно в 2 раза…
Всё полезное из чата @devsigners — инструменты, ссылки, приёмы и ответы на вопросы. Пополняется сама.
Обновлено сегодня в 05:00 · всё из чата обработано
7 записей Сбросить
В чат переслали заметку из канала «LLM под капотом»: по их бенчмарку Kimi K3 сравнима с GPT-5.5 Pro по очкам, примерно в 15 раз дешевле и примерно в 2 раза…
В чате переслали новость о релизе Claude Fable 5 и бенчмарках, где заявлены сильные результаты в кодинге и агентных задачах: 80,3% на SWE-Bench Pro и миграция…
Участник поделился анонсом Cursor Composer 2: по внутреннему CursorBench модель заявлена на уровне GPT-5.4 и Opus 4.6…
В чат переслали сообщение о выходе Gemini 3.1 Pro с заявленными 77,1% в ARC-AGI-2, двукратным ростом к прошлой версии и сильными результатами в кодинге и…
В чате поделились анонсом Qwen3-Coder-480B-A35B-Instruct: у модели 35B активных параметров, и в посте утверждается, что она обгоняет Kimi K2, DeepSeek V3 и…
Полные саммари, ссылки и переходы к исходным сообщениям. Войдите через Telegram — проверим, что вы в @devsigners.