Рубрика «AI safety»

Разговор о сверхразумном ИИ почти всегда быстро сворачивает к одному вопросу: уничтожит ли он человечество? Если вы смотрели интервью Романа Ямпольского, вы знаете эту интонацию — сверхИИ может оказаться неконтролируемым и непредсказуемым, а попытка удержать его под контролем будет похожа на попытку муравья судить футбольный матч.

Тревога не глупая, и риск уничтожения обсуждать нужно. Но у такой постановки есть дефект: она делает будущее бинарным. Либо ИИ нас убивает, либо мы выживаем. А между этими двумя исходами лежит куда более широкая и куда менее уютная зона.

Читать полностью »

Представьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным. Третий отправляет офферы тем, кто прошел все этапы. Люди убраны из цепочки ради скорости — все работает, метрики растут.

Через месяц выясняется, что первый агент систематически отсеивал кандидатов старше 40 лет. Но никто этого не заметил, потому что все положились на ИИ.

Читать полностью »

Предыстория

Давеча я обсуждал в агентской сессии, почему старая задача перестала находиться после переименования проекта. Ситуация выглядела достаточно простой: у задачи был стабильный идентификатор, проект когда‑то назывался иначе, а текущий механизм поиска, судя по всему, продолжал учитывать не только идентификатор задачи, но и имя проекта, которое давно изменилось.

Агент быстро подтвердил проблему, нашёл место, где точечный поиск всё ещё зависел от имени проекта, сформулировал вполне разумную гипотезу исправления, после чего начал читать код, менять несколько файлов и добавлять тесты.

Читать полностью »

Промпт меняет не только тон — он меняет то, кем модель является.

Читать полностью »

TL;DR: Шесть метрик RAGAS + Precision@K/Recall@K/MRR позволяют поймать деградацию RAG-системы до того, как пользователи заметят галлюцинации. В этой статье будет всё от pip install ragas до автоматических проверок в CI/CD, включая security-тесты на document poisoning.

Проблема

RAG ломается не так, как обычный LLM. У голой языковой модели одна поверхность отказа: генерация. Модель галлюцинирует, отвечает невпопад, игнорирует инструкции. У RAG-системы таких поверхностей две: retrieval и generation. И они ломаются по-разному.

Читать полностью »

День после появления AGI - 1

Эти два человека строят электронного бога. Оба хотели бы остановиться.

В январе на Давосе случилось то, чего не бывает: два человека, строящие одну и ту же технологию в конкурирующих компаниях, сели рядом и начали вслух считать, сколько им осталось до точки невозврата.

Читать полностью »

Модели машинного обучения (ML) становятся ключевой частью современных продуктов и сервисов, и вопросы их безопасной разработки выходят на первый план. Однако на практике у многих команд нет понимания, как именно выстраивать защиту — на каких этапах, с помощью каких инструментов и против каких угроз.

Меня зовут Александр Серов, я ведущий специалист по безопасности больших языковых моделей в Swordfish Security. В этой статье я покажу, как подходить к безопасности ML-систем системно — через уровни зрелости, жизненный цикл моделей и реальные практики.

Читать полностью »

ИИ, который учится без данных: как Absolute Zero Reasoner меняет машинное обучение

Представьте ИИ, который не нуждается в миллионах размеченных примеров, не требует армии разметчиков из Кении, и может совершенствоваться, создавая задачи и непрерывно обучаясь у самого себя? И нет, это уже не фантастика — система Absolute Zero Reasoner доказала, что такой подход не только работает но и крайне эффективен.

Читать полностью »

https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js