Рубрика «Ollama»

Предыстория

Последние полгода с лишним я занимаюсь работой с LLM и созданием ИИ-персонажа. За это время я столкнулся с множеством проблем, решением которых хотел бы поделиться и, возможно, посоветоваться.

Кому подойдёт эта статья

  • Тем, кто хочет создавать прописанных персонажей для RP или ИИ-компаньонов

  • Энтузиастам, что хотят оживлять популярных персонажей из игр/комиксов/аниме

  • ИИ-энтузиастам

Начало опытов

Когда я только начал попытки создания своего пет-проекта с ИИ, я столкнулся с проблемой — вектор диалога меняется каждый ход и в конце концов становится неуправляемым.

Читать полностью »

Полгода назад я прикинул, сколько рабочих созвонов ежедневно улетает на чужие сервера через модные ИИ-ноутейкеры. Стало как-то неуютно. Otter, Granola, Fireflies — все льют разговоры в облако. Granola в этом году вообще отличилась: The Verge раскопали, что заметки по дефолту доступны любому по ссылке, а на пользовательских данных крутят модели (opt-out ожидаемо зарыт в Enterprise-тарифе).

Решил проверить, можно ли собрать ассистента целиком на своём железе. Спойлер: можно. Работает каждый день на M1 Max под Apache 2.0.

Что получилось

Читать полностью »

Об открытых языковых моделях написано много — и почти все статьи посвящены знакомству, в лучшем случае — «медовому месяцу» использования. Бенчмарки, рейтинги «лучших моделей года», полевые тесты на одной задаче, руководства. Гораздо реже говорят, что происходит потом: как ведет себя модель спустя месяцы непрерывной работы, где и почему начинает сбоить, что ломается под нагрузкой и какие инженерные решения постепенно вытесняют первоначальные представления о том, «как надо». 

В WB-TechЧитать полностью »

Дисклеймер: это не юридическая консультация. Я айтишник, к.т.н. и преподаватель ИТ-дисциплин, а не юрист. Ниже — взгляд практика, который учит сотрудников компаний работать с нейросетями и постоянно натыкается на эти вопросы вживую.

За последний год я провёл серию корпоративных тренингов по использованию ИИ для рабочих офисных задач — в разных по размеру компаниях. И очень часто в перерыве кто-нибудь из участников подходит и вполголоса спрашивает — «а ничего, что я договор с клиентом закидывал в ChatGPT, чтобы он мне выжимку сделал?»

Читать полностью »

Введение

В существующей системе мониторинга Oracle уже использовалось разработанное мной решение, которое с интервалом в 1 минуту собирало метрики производительности из представления V$WAITCLASSMETRIC и отображало их в Grafana. Графики наглядно показывали изменения времени ожиданий в классах User I/O, Commit, Concurrency и других, однако они показывали лишь сам факт изменения нагрузки, не объясняя его причины.

Читать полностью »

Недавно я делал учебный проект про автоматизацию документирования инцидентов. Поначалу планы были грандиозными: инциденты, таймлайны, интеграции с мониторингами, чатами, постмортемы, подсказки дежурным инженерам.

Но довольно быстро стало понятно, что с временными и ресурсными ограничениями лучше не пытаться написать маленький PagerDuty. Поэтому я сузил задачу до более реалистичного ядра: локального RAG-сервиса, который ищет по документации, ранбукам и коду, а затем передаёт найденный контекст в LLM.

Так появился llmortem — FastAPI-сервис, который можно подключить к OpenWebUI как OpenAI-compatible backend.

Читать полностью »

Поднимаем Llama 3 в облаке: Ollama и Open WebUI - 1

Локально запустить LLM сегодня можно за десять минут — например, с помощью LM Studio. Но как только модели нужно дать доступ команде, подключить RAG или встроить ее в сервис — такого подхода зачастую недостаточно.

Читать полностью »

Я решил проверить, на что способен мой старый компьютер с Radeon RX 580 под управлением Fedora. В этой статье я пошагово разберу, как завести современный ИИ-стек (Ollama, n8n, Open WebUI) через Vulkan без боли с ROCm, и почему 15-35 токенов в секунду на железе 2017 года — это реальность, доступная каждому.

Мой компьютер у меня с 2018 года. FedoraЧитать полностью »

Наблюдая за тем, как ИИ внедряется на работе и дома, я всё чаще ловлю себя на простой мысли: всё труднее писать код самому и всё больше хочется делегировать ИИ.

Да ещё и провайдеры ИИ призывают тратить больше токенов, руководители всё чаще призывают команды активнее пользоваться ИИ. В соцсетях регулярно попадаются шуточные видео про то, как CEO предлагает потреблять токены ради самого потребления, а в медиа уже обсуждают tokenmaxxing: сотрудники и команды соревнуются в потреблении AI-токенов, а один инженер OpenAI, по данным New York TimesЧитать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js