Рубрика «llm» - 7
Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне
2026-07-08 в 12:28, admin, рубрики: AI Evaluation, Hallucination Detection, llm, LLM-as-a-judge, machine learning, nlp, rag, RAGTruth, Галлюцинации LLM, генеративный ииИногда самое опасное в исследовании — получить слишком красивый результат.
Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.
Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.
Что работает — и это мы не отзываем
Аутентификация в MCP в 2026: как было, как есть и как будет
2026-07-07 в 11:41, admin, рубрики: ai-агенты, llm, MCP, model context protocol, OAuth 2.1, PKCE, resource server, RFC 9728, авторизация, аутентификацияПару лет назад мы масштабно столкнулись с совершенно новой технологией, которая пришла вместе с развитием агентов и LLM — MCP. Она заточена на то, чтобы дать модели интерфейс для общения с какой‑либо системой, программой или сервером. Изначально MCP были локальными и скромными: «запусти калькулятор», «проверь календарь», «удали лишние фоточки из галереи». Но очень быстро они доросли до remote‑серверов: вставляешь в Claude адрес своего MCP, и он сразу понимает, что сервер умеет, куда подключаться и как с ним общаться. Большое спасибо за это протоколуЧитать полностью »
От Triton Inference Server к NVIDIA Dynamo: как изменился inference для агентов в 2026
2026-07-07 в 9:41, admin, рубрики: AI, dynamo, gpu, llm, NvidiaКак на самом деле работают LLM
2026-07-07 в 8:05, admin, рубрики: AI, artificial intelligence, llm, machine learning, ml, timeweb_статьи_перевод, большая языковая модель, искусственный интеллект, машинное обучениеВ статье подробно рассматриваются принципы работы больших языковых моделей (large language model, LLM). Поскольку в основе большинства современных LLM лежит архитектура трансформера (transformer), ее понимание дает представление о ключевых механизмах, обеспечивающих работу таких моделей.
В этой статье мы разберем ключевые принципы работы современных LLM, построенных на архитектуре трансформера. Я постараюсь объяснить основные идеи без погружения в сложную математику. Конечно, для глубокого понимания темы математическая база важна, но для первого знакомства этого материала должно быть достаточно.
GigaChat 3.5 — меньше, быстрее, сильнее
2026-07-06 в 8:48, admin, рубрики: llm, анонс, анонс моделей ииСалют!
Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — нашу новую 432B-модель. В этом релизе мы впервые для нашей линейки масштабировали собственную гибридную архитектуру на сотни миллиардов параметров, ускорили инференс и усилили модель в коде, агентных сценариях и сложных областях.
GigaChat 3.5 Ultra компактнее прошлого флагмана: 432 млрд параметров вместо 700 млрд у GigaChat 3.1 Ultra. Но это не компромисс «меньше, зато дешевле»: за счёт новых данных, обновлённого рецепта обучения и архитектурных изменений модель стала сильнее, а также эффективнее по памяти и скорости генерации.
Интересно? Добро пожаловать под кат.
Продакшн на Laravel руками ИИ‑агента: честный отчёт о том, что работает, а что чуть не уронило прод
2026-07-06 в 7:59, admin, рубрики: claude, claude code, laravel, llm, php, зерокодинг, продакшн, разработка через ИИ, тестированиеЯ аналитик, а не разработчик. Весь код для созданной нами платформы написал Claude Opus через Claude Code. Рассказываю без хайпа: как выглядит реальный workflow, где нейросеть незаменима, где она бесполезна, и какая инженерная дисциплина обязательна, чтобы это не превратилось в тыкву на боевом.
Сразу обозначу рамку, чтобы снять половину вопросов из комментариев.
Я не умею писать продакшн‑код. Я аналитик: читаю код, рассуждаю о системах, проектирую поведение — но профессионально не кодю. Тем не менее у нас в проде работает нетривиальное веб‑приложение, и каждую строчку кода написала нейросетьЧитать полностью »
Почему ChatGPT называет одни бренды и молчит про другие: как машина знает компании
2026-07-05 в 12:15, admin, рубрики: aeo, entity seo, geo, gpt, knowledge graph, llm, schema.org, seo, wikidata, нейропоискЯ изучаю AEO/GEO (продвижение брендов в ответах нейросетей) и наткнулся на разбор про странную вещь: нейросети называют одни бренды и будто не замечают другие, причём качество продукта тут ни при чём (SearchAtlas). Объясняют это через понятие сущности: и поиск, и нейросети воспринимают бренд как отдельный объект знания со своими свойствами и связями.
Гибель богов. Fable и ещё 10 LLM реорганизуют код. Сравнение
2026-07-05 в 12:05, admin, рубрики: deepseek, fable, langgraph, llm, LLM-as-a-judge, архитектура по, бенчмарки LLM, ии-агенты, нейросети, рефакторингРусский и английский оригиналы статьи в моём блоге.
Это подробный разбор одного эксперимента. Я взял god node из реального LangGraph агента и попросил 5 американских и 6 китайских моделей сначала предложить, как её распутать, а потом оценить предложения друг друга. Дальше тремя разными способами пытался понять, кому из них в этом деле верить.
Оглавление
-
Исходная задача. Что за god node и чем она опасна.



