Рубрика «pytorch» - 3
Долгая дорога к DiT (часть 2)
2025-10-26 в 15:29, admin, рубрики: diffusion models, mnist, python, pytorchСобираем ANPR-систему на Python: от YOLOv8 и кастомного OCR до INT8-квантизации
2025-10-24 в 21:15, admin, рубрики: anpr, ml, ocr, python, pytorch, yolov8Мы решили задачу омографов и ударений в русском языке
2025-10-09 в 18:34, admin, рубрики: PyPi, python, pytorch, silero, нейросети, омографы, разрешение омографов, русский язык, синтез речи, ударение
Мы наконец решили задачу омографов. Конечно, с рядом оговорок, куда без них. Получилось пресловутое приключение на 20 минут.
Лучшие фреймворки для машинного обучения в 2025 году
2025-09-25 в 7:46, admin, рубрики: catboost, jax, LightGBM, ml, pytorch, scikit-learn, TensorFlow, xgboost, фреймворкиСегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта.
Долгая дорога к DiT (часть 1)
2025-09-06 в 9:15, admin, рубрики: diffusion models, pytorch, искусственный интеллектЭто лето обрадовало нас прорывом в обработке изображений с помощью нейросетей. Одна за другой выходят такие модели как Flux.1 Kontext, Qwen-Image-Edit, Gemini 2.4 Flash Image Preview (Nano Banana) демонстрируя недостижимый до сих пор уровень манипуляции цифровым контентом. Это не замена Фотошопу, а технология, открывающая врата в бесконечные визуальные миры и всё благодаря мощи Diffusion Transformer (DiT) архитектуры. Впечатлившись, я решил поближе познакомиться с диффузными трансформерами - собственноручно натренировать свою собственную DiT-модель. Об этом и будет эта статья.
Но начать стоит с малого.
Базовая модель
Новый релиз публичного детектора голоса Silero VAD v6
2025-08-26 в 7:50, admin, рубрики: ONNX, open source, PyPi, python, pytorch, silero, voice activity detection, голосовое управление, голосовой помощник, детектор голоса
На Хабре уже было аж 3 статьи про развитие нашего публичного детектора голоса Silero VAD (последняя тут). А вот что стало лучше в этот раз:
-
Все прошлые фишки и Читать полностью »
Собираем MVP product search: дообучение E5 и веб-сервис для сравнения поисковых выдач
2025-07-07 в 21:47, admin, рубрики: E5, huggingface, information retrieval, machine learning, mvp, nlp, pytorch, semantic search, streamlit, дообучение моделейЧто важнее: создать продукт, или доставить его до пользователя? Оба этапа необходимы. Сегодня обсудим второй. Как нам построить поисковую e-com систему.
Покажем, что в слово логистика товара входят сложные задачи не только: перевезти наушники из Китая в Америку, но и настройка поисковой выдачи по запросу.
Быстро соберем поисковой MVP-сервис. Дообучим модель E5 на реальных данных от Amazon. Определим метрики качества и сравним BM25, pretrain E5 и fine-tune E5. Так же взглянем глазами с отладочной информациейЧитать полностью »
Я построил Vision Transformer с нуля — и научил его обращать внимание
2025-07-04 в 13:16, admin, рубрики: computer vision, deep learning, implementation, pytorch, TransformersVision Transformer (ViT) — это архитектура, которая буквально произвела революцию в том, как машины «видят» мир.
В этой статье я не просто объясню, что такое ViT — я покажу вам, как создать эту магию своими руками, шаг за шагом, даже если вы никогда раньше не работали с трансформерами для задач с изображениями.
Для начала давайте взглянем на архитектуру Vision Transformer:


