Парный опыт над двумя фронтирными моделями, разбор двух разных механизмов отказа и проверка собственного вывода по литературе, которая его обрушила.
Рубрика «gpt-5»
Определитель повадок: пять способов, которыми разговор с LLM имитирует доказательство
2026-09-17 в 13:29, admin, рубрики: AI, claude, gpt-5, автономные лаборатории, ИИ, искусственный интеллект, машинное обучение, научпоп, солнечная энергетикаПять моделей, пять исходов: что симуляция обществ рассказала о специализации ИИ
2026-06-24 в 13:01, admin, рубрики: AI safety, claude, Emergence AI, gemini, gpt-5, grok, агентный ИИ, безопасность ии, ии-агенты, симуляция обществаПредставьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным. Третий отправляет офферы тем, кто прошел все этапы. Люди убраны из цепочки ради скорости — все работает, метрики растут.
Через месяц выясняется, что первый агент систематически отсеивал кандидатов старше 40 лет. Но никто этого не заметил, потому что все положились на ИИ.
Opus 4.7 vs GPT-5 vs DeepSeek V4-Pro: три агента строят TSS-CLI на Rust
2026-05-07 в 19:13, admin, рубрики: agents, AI, claude, deepseek, gpt-5, llm, MPC, Rust, threshold-signaturesTL;DR
24 апреля 2026 DeepSeek в режиме preview выкатил V4-Pro — MoE на 1.6T параметров (49B активных), 1M контекста. Появился повод посадить три флагманские модели за один и тот же не самый тривиальный таск и посмотреть, кто как справится. Задание общее, машина одна, час один, всё запускалось параллельно:
|
Модель |
Harness |
Reasoning effort |
|---|---|---|
|
Anthropic Opus 4.7 (1M ctx) |
Claude Code |
x-high |
|
OpenAI GPT-5 |
Codex |
high |
|
DeepSeek V4-Pro |
OpenCode |
high (max) |
ChatGPT не промахнулся ни в одном из пяти медицинских кейсов. И всё равно проиграл. Разбираем, почему
2026-04-26 в 16:15, admin, рубрики: benchmark, chatgpt, gpt-5, llm, ocr, клинические решения, медицина, расшифровка анализов, русскоязычные LLM, экспериментTL;DR
В эксперимент мы шли с уверенностью, что ChatGPT хотя бы раз из пяти промахнётся с главным диагнозом. Не промахнулся. Пять из пяти: метаболический синдром, субклинический гипотиреоз, перименопауза, MGUS, статин-индуцированный рабдомиолиз. Ставка проиграна, но самое интересное оказалось не здесь.
Когда нейросеть решит то, что не решил никто?
2026-01-28 в 22:12, admin, рубрики: Epoch AI, FrontierMath, gemini, gpt-5, llm, research taste, бенчмарки, открытые задачи, теория чисел
В середине 2024 года GPT-4 спотыкался на школьных задачах, а к концу 2025-го модели щёлкали олимпиадные как орехи. Полтора года, и мы преодалели дистанцию от «найди икс» до «докажи теорему». Epoch AI решили заглянуть еще дальшеЧитать полностью »
Нейро-дайджест: ключевые события мира AI за 2-ю неделю октября 2025
2025-10-09 в 14:05, admin, рубрики: Anthropic, gpt-5, OpenAI, sora, timeweb_дайджест, вайбкодинг, дайджест, ИИ, нейросети, Новости
Привет! Это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут ВандерЧитать полностью »
У меня нет рта, но я должен выводить эмодзи морского конька
2025-10-06 в 11:55, admin, рубрики: Claude Sonnet, gpt-5, large language models, большие языковые моделиGPT-5 и API Responses: зачем нужен ещё один стандарт?
2025-10-01 в 12:30, admin, рубрики: gpt-5, OpenAI, Responses API, агенты, инструменты, мультимодальность, производительность, разработчики, рассуждения, сохранение состоянияКоманда AI for Devs подготовила перевод статьи о новом API /v1/responses от OpenAI, который объединяет простоту Chat Completions и мощь Assistants, и при этом сохраняет состояние рассуждений, мультимодальность и встроенные инструменты. Это шаг к агентам будущего — и, похоже, к новому стандарту работы с моделями OpenAI.
GPT-5 уже вышел, и мы хотим подробнее рассказать о наилучших способах его интеграции, об API Responses и о том, почему Responses идеально подходит для моделей рассуждения и для будущего, ориентированного на программных агентов.
Ограничение контекстного окна GPT-5 и его эффективное использование в Bothub
2025-10-01 в 9:32, admin, рубрики: AI, gpt-5, ИИ, искусственный интеллект, контекст, контекстное окно, оптимизация, токены, эффективное использованиеДоброго времени суток, «Хабр»!
В сегодняшней статье мы разберемся в ограничениях контекстного окна GPT-5, рассмотрим его применение относительно Bothub и ответим на вопрос: как повысить эффективность?
Присаживайтесь поудобнее, я начинаю свое повествование.

