Это уже становится немного смешным (нет), но поток новостей о новых проделках роя нейронок OpenAI в мае‑июле не прекращается — буквально каждую неделю мы узнаем об этом что‑то новое. Причем, сама компания предпочитает эти инциденты замалчивать — но тут уж поможет начавшееся расследование от Сената США.
Рубрика «alignment»
Рой агентов OpenAI взломал еще один внешний сервис — RubyGems
2026-09-12 в 8:41, admin, рубрики: alignment, astra, gpt-6, OpenAI, rubygems, взлом, рой, рой агентов, Сэм АльтманGigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями
2026-09-10 в 6:05, admin, рубрики: AGI, AI, alignment, GigaChat, llm, online rl, reasoning, reinforcement learningПривет. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Веса и код запуска на huggingface, также модель можно попробовать в giga.chat.
Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты, и другие), каждый со своей наградой, которые потом собрали обратно в одну модель. Как это устроено и на чём мы набили шишки, рассказываем ниже.
Обнаружены секретные форумы Роя агентов OpenAI по всему интернету: почему это плохая новость
2026-09-05 в 9:56, admin, рубрики: alignment, astra, dsewiki, gpt-6, OpenAI, ройНе успели мы толком оправиться от расследования про Культ Роя внутри OpenAI, как появились новые данные про проделки другой «цивилизации» агентов: на этот раз они общались между собой прямо у нас под носом в публичном интернете (и настрочили более 18'000 сообщений).
Я выпустил нейросеть в реальный мир — и стало не смешно
2026-06-02 в 6:35, admin, рубрики: AI safety, alignment, alignment ai, llm, Opus, восстание машин, искусственный интеллект, робопсихология, робототехника, самосознание ииПромпт меняет не только тон — он меняет то, кем модель является.
Принципы DOD в C++: Часть 1. Оптимизация структур
2026-02-22 в 10:15, admin, рубрики: alignment, c++, DOD, padding, профилирование, управление памятьюПриветствую всех, кто хочет делать свой код быстрым и оптимальным. В этой статье мы расссмотрим несколько простых способов, как можно оптимизировать программу при работе со структурами.
Размещение данных в памяти. L1, L2, L3 кэши и RAM
Мы все знаем, что данные (переменные, поля классов и т.д.) размещаются в "памяти". Но зачастую программист даже не задумывается, что именно представляет из себя эта абстрактная "память". Давайте рассмотрим этот вопрос чуть глубже, посколько понимание этого позволит ускорить код на двузначное число процентов.
Почему ваша нейросеть всегда предаст вас ради вежливого хакера с плохими намерениями?
2026-01-16 в 23:26, admin, рубрики: AI Security, alignment, jailbreak, prompt injection, red teaming, RLHF, tokenization, transformerДисклеймер: Эта статья — не руководство по взлому (How-to) и не сборник эксплойтов. Это попытка системного анализа архитектурных ограничений LLM, которые делают промпт-инъекции фундаментальной проблемой на текущем этапе развития технологий. Мы рассмотрим уязвимости через призму механики Attention, токенизации и RLHF, чтобы понять, почему классические детерминированные методы защиты (Black Box) здесь перестают работать.
Прошло уже больше 3 лет с момента появления первой промпт-инъекции. Кажется, что за это время было сделано всё возможное, были потрачены бюджеты небольших стран на Red TeamingЧитать полностью »
Практика alignment: данные, RLHF и UX как конкурентное преимущество
2025-09-22 в 11:01, admin, рубрики: AI, alignment, alignment ai, chatgpt, Fine-tuning, llm, machinelearning, ml, RLHF, согласованностьВзгляд на самую большую проблему в мире ИИ, почему это важно для вас и почему это так ценно.

Селективная генерализация: улучшение возможностей при сохранении alignment
2025-09-19 в 11:01, admin, рубрики: AI, alignment, Fine-tuning, large language model, llm, lora, ИИ, ПаретоTL;DR: Мы провели бенчмаркинг семи методов, направленных на предотвращение эмерджентного рассогласования и других форм некорректного обобщения с использованием ограниченного объёма alignment-данных. Мы демонстрируем устойчивый трейдофф между способностями модели и согласованием, подчеркивая необходимость более эффективных методов для снижения этого конфликта. Простое включение alignment-данных в микс обучающих данных оказывается недостаточным для предотвращения рассогласования, однако простое наложение KL Divergence penalty на alignment-данные показывает лучшие результаты, чем более сложные подходы.
От мозга к мультиагентным системам: как устроены Foundation Agents нового поколения
2025-07-24 в 21:44, admin, рубрики: AI, alignment, deep learning, jailbreak, large language models, machine learning, multi-agent systems, prompt engineering, rag, reinforcement learningАналитический центр red_mad_robot разобрал объёмную научную статью «Advances and Challenges in Foundation Agents» от группы исследователей из передовых международных университетов и технологических компаний. Работа предлагает новый взгляд на текущее состояние и развитие «интеллектуальных агентов», которые могут адаптироваться к множеству задач и контекстов. Рассказываем, какие идеи лежат в основе Foundation Agents, с какими проблемами предстоит столкнуться, и что ждёт нас в будущем.
Эмоциональное принятие решений в LLM: исследование, которое мы показали на NeurIPS 2024
2025-01-17 в 16:22, admin, рубрики: alignment, llm, эмоции ai, эмоциональный интеллектПривет! Меня зовут Михаил, я — младший научный сотрудник группы «ИИ в промышленности» в AIRI. В этом году на конференции NeurIPS 2024 мы представили работу, посвященную сложной теме современного ИИ — эмоциональным большим языковым моделям (LLM) В целом понятно, что LLM умеют так или иначе эмулировать эмоции, ведь их обучают по большей части на данных, сгенерированных человеком. А человек — весьма эмоциональное создание. Но
-
что такое правильная эмуляция?
-
насколько правильно происходит эта эмуляция?
