Рубрика «метрики качества»
Как повысить отказоустойчивость сервисов в кластере виртуализации с помощью оптимизации их распределения
2026-07-01 в 9:18, admin, рубрики: балансировка нагрузки, виртуализация, виртуальные машины, инфраструктура, кластер, метрики качества, надежность, оптимизация, отказоустойчивость, сервисыСуть проблемы
Кластер виртуализации содержит множество гипервизоров. На каждом гипервизоре разворачивается множество виртуальных машин. Каждая машина, как правило, отвечает за работу одного сервиса.
Если части одного сервиса развернуты на нескольких машинах (например, реплики или ноды), для краткости такой сервис будет называться распределенным. Каждый распределенный сервис может быть распределён неравномерно, что снижает его отказоустойчивость.
Далее под распределением сервисов предлагается понимать распределение виртуальных машин, на которых запущены части одного сервиса.
Почему бенчмарки в AI сломались — и что с этим делать в понедельник
2026-05-12 в 6:15, admin, рубрики: ai-агенты, llm, агентные системы, Анализ и проектирование систем, бенчмарки, закон Гудхарта, критическое мышление, метрики качества, нейросети, оценка LLMВ январе 2026 года Янн Лекун, уходя из Meta, сказал в интервью Financial Times про релиз Llama 4: «The results were fudged a little bit» (Fast Company, 6 января 2026). Команда показывала на LMArena одну версию модели, в продакшен ушла другая. На бенчмарке всё было правильно. В реальности код был хуже DeepSeek V3.
Я хочу разобрать эту историю. Не потому что Meta — исключение. Потому что они — симптом.
TL;DR.Читать полностью »
Как оценить качество машинного перевода
2025-10-14 в 10:46, admin, рубрики: bleu, comet, llm, machine translation, машинный перевод, метрики качества, оценка качества, переводчик, переводчики, языковые моделиРаботая в области машинного перевода в компании Lingvanex, я постоянно читаю статьи в которых сравнивается качество разных переводчиков. Иногда отличие между ними составляет от 0.3 до 1% по какой-либо из метрик, но и это уже повод заявить, что их переводчик - лучший.
При оценке качества машинного перевода важно не только сравнить результаты различных систем перевода, но и проверить, являются ли обнаруженные различия статистически значимыми. Это позволяет оценить, насколько полученные результаты достоверны и могут ли они быть применимы к другим наборам данных.
GPT-4o vs YandexGPT: как мы отлаживали метрики в DeepEval из-за требований ИБ
2025-08-15 в 7:20, admin, рубрики: DeepEval, llm, автоматизация тестирования, консистентность, метрики качества, релевантностьВведение: Наш самый полезный баг
Привет, я Рамиль, QA-инженер в компании Raft. В своей работе я фокусируюсь на автоматизации тестирования, в том числе для LLM-решений, где часто использую связку Pytest и специализированных фреймворков. Эта статья — история из нашей недавней практики.
Когда перед нами встала задача построить автоматизированную систему оценки (evaluation) для LLM-классификатора, который должен был сортировать запросы клиентов, выбор инструментов казался очевидным. Мы взяли DeepEvalЧитать полностью »
IT БЕЗ ГРЕЙДОВ – КАК МЫ ОЦЕНИВАЕМ ЭФФЕКТИВНОСТЬ РАЗРАБОТЧИКА И КОМАНДЫ
2025-06-11 в 12:50, admin, рубрики: грейды, компетенции, метрики качества, метрики кода, мотивация в ИТ, мотивация программистов, мотивация разработчиков, разработчики, система оценки персонала, эффективность трудаПочти 6 лет мы в WPP.DIGITAL использовали классические грейды, чтобы оценивать квалификацию наших разработчиков. За это время пережили многое: проводили многочасовые интервью, шлифовали матрицу компетенций, убеждали сеньоров не скромничать, а джунов – не быть слишком уверенными в себе. Но вопросы все равно оставались: что делать, когда разработчик крут в одном стеке, но новичок в другом? Какой у него грейд? И главное – отражают ли оценки реальную эффективность специалиста?
Метрики для технологий письменного общения
2024-12-06 в 10:56, admin, рубрики: дискурс, дискурсивные техники, коммуникация, метрики, метрики качества, общение, письменность, социология, текст, теория коммуникацииПредлагаются метрики для оценки общения при помощи текста. Делается вывод, что по большинству метрик в интернете нет прогресса по сравнению с временами бумажного общения.
Новые способы отслеживать прогресс в полупроводниковых технологиях
2024-08-13 в 10:19, admin, рубрики: FinFET, метрики качества, метрики производительности, нанометры, наноэлектроника, техпроцессы, чипы 10-нм, чипы памятиОдним из самых известных принципов в мире технологий, конечно, является закон Мура. На протяжении более 55 лет «закон» описывал и предсказывал уменьшение транзисторов, указывая так называемые «технологические нормы». Словно некие «часы судного дня», с каждым годом уменьшались размеры основных элементов интегральной схемы, поэтому инженерам удавалось регулярно удваивать количество транзисторов на чипе.
Примечательно, что когда Гордон Мур высказал идею своего закона, технологии интегральных схем позволяли размещать всего около полусотни транзисторов на один кристалл.
Использование кастомных функций потери и метрики качества обучения в Keras
2019-11-23 в 14:43, admin, рубрики: keras, loss, машинное обучение, метрики качества, нейронные сети, оптимизация, функция потерьПри обучении нейронной сети на обучающей выборке на выходе нейросети вычисляются два ключевых параметра эффективности обучения — ошибка и точность предсказания. Для этого используются функция потери (loss) и метрика точности. Эти метрики различаются в зависимости от поставленной задачи (классификация или сегментация изображения, детекция объекта, регрессия). В Keras мы можем определить свои собственные функцию потери и метрики точности под свою конкретную задачу. О таких кастомных функциях и пойдет речь в статье. Кому интересно, прошу под кат.
Читать полностью »
А не фигню ли я опять делаю? Как и зачем внедрять метрики качества
2019-09-20 в 6:54, admin, рубрики: Dodo IS, Dodo Pizza Engineering, Блог компании Dodo Pizza Engineering, метрики качества, метрики продукта, оценка качества, тестирование по, управление проектами, управление разработкойПривет! Когда-то мы использовали метрику «Вроде бы стало лучше» для оценки качества наших релизов. Но потом мы решили довериться чему-то более надёжному. В этой статье я расскажу о том, как искал гайд по метрикам, не нашёл и создал свой.


