Рубрика «reinforcement learning»

Привет. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Веса и код запуска на huggingface, также модель можно попробовать в giga.chat.

Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты, и другие), каждый со своей наградой, которые потом собрали обратно в одну модель. Как это устроено и на чём мы набили шишки, рассказываем ниже.

Читать полностью »

Прошло почти два года с тех пор, как OpenAI выпустила o1, модель, которая популяризировала reasoning в LLM. Примерно через четыре месяца появился DeepSeek-R1. Вместе с ним авторы подробно описали, как обучать reasoning-модели с помощью reinforcement learning with verifiable rewards (RLVR), то есть RL на проверяемых наградах.

На прошлой неделе OpenAI представила семейство моделей GPT-5.6. В него входят модели трех размеров, и для каждой предусмотрено пять или шесть настроек reasoning effort.

Читать полностью »

За один 2026 год двуногие роботы успели пробежать полумарафон быстрее человеческого рекорда, довести публику до того, что CEO пришлось резать роботу ногу ножницами прямо на сцене, и провалить задачу «пройтись ровно» на презентации за миллионы долларов. В апреле гуманоид Honor Robotics D1 финишировал в Пекине за 50 минут 26 секунд — у людей мировой рекорд, 57:20 Джейкоба КиплимоЧитать полностью »

TL;DR: Начал с фантазий про телепортацию из рассказа Стивена Кинга, закончил Python-пакетом для управления сканирующим туннельным микроскопом. 41 тест, симулятор вместо оборудования за $500K, замена LabVIEW на asyncio. pip install amrl-transport - и можно тренировать RL-агента для манипуляции отдельными атомами, не выходя из дома.

Как все началось

Есть у Кинга рассказ «Долгий Джонт» (The Jaunt). Там телепортация работает так: объект разбирается в точке A и собирается в точке B. Мгновенно. "Джонт горка" все дела.

Читать полностью »

Изображение создано с помощью ChatGPT

Изображение создано с помощью ChatGPT

Что влияет на размер вашего кредитного лимита? И почему банк может вдруг его уменьшить, даже если вы всегда вовремя вносите платежи? В предыдущей статьеЧитать полностью »

Всем привет! Недавно я познакомился с курсом по глубокому обучению с подкреплением от HuggingFace Deep Reinforcement Learning Course и захотел сделать выжимку самого интересного. Эта статья — своего рода шпаргалка по основам Reinforcement Learning (RL) и одному из ключевых алгоритмов — PPO, который лежит в основе тонкой настройки современных LLM (Large Language Models).

Вы наверняка слышали про такие модели, как o1 от OpenAI или QwQ от Alibaba. Их "рассуждающие" способности во многом — результат применения RL. Давайте разберемся, как обычный принцип обучения, известный по играм вроде AlphaGo, помогает языковым моделям стать умнее.Читать полностью »

Для меня разобраться в базовых концепциях Reinforcement Learning оказалось не так просто, особенно сложными оказались функции Беллмана. Эта статья — моя попытка систематизировать материал и объяснить себе (и, возможно, другим), что, откуда и почему берется. Будет здорово, если она поможет кому-то разложить все по полочкам.

¯_(ツ)_/¯

Полезные ссылки:
Practical RL (ШАД) (самые полезные материалы были тут)
Лекция №15 "Обучение с подкреплением"
Тренировки. Лекция 3: Введение в обучение с подкреплением
Читать полностью »

IoT-сети проектировали для миллионов устройств, но они захлебываются уже от тысяч. Когда в нашем районе на секунду моргнул свет, 10 000 умных счетчиков одновременно потеряли связь и начали переподключаться. Три четверти так и не смогли выйти в эфир. Проблема в RACH — канале случайного доступа. При массовых подключениях он превращается в узкое горлышко, куда каждый пытается прорваться первым.

Читать полностью »

Привет!
Меня зовут Роман, я NLP-инженер в Сбере. Занимаюсь мультиагентными системами и работаю с LLM в проде. Сегодня расскажу про одну из самых интересных статей июня по версии Huggingface Daily Papers — Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning.

TL;DR

Авторы предлагают простой, но мощный метод: если первая попытка модели провалилась, она должна написать краткую саморефлексию, а затем сделать повторную попытку. Если она успешна — награду получают только токены саморефлексии.

Читать полностью »

Новый метод поиска от Sakana: расширение inference-time scaling и коллективный разум - 1

Аналитический центр red_mad_robot продолжает разбирать исследования японской лаборатории Sakana AI — в прошлый разЧитать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js