Рубрика «Ollama»

Хотел свою систему, которую можно менять когда угодно, и сделал три десктопных AI-приложения

Привет! Это моя первая статья, и она про Zeqou: небольшую экосистему десктопных приложений для работы с языковыми моделями. Два приложения уже готовы, третье выйдет совсем скоро. Расскажу, что они умеют, как устроены и с какими неожиданными проблемами я столкнулся.

Коротко. Zeqou — это три приложения: чат, рабочее пространство для агентов и студия дообучения моделей. Они бесплатные и работают на Windows, macOS и Linux. Чат и Harness готовы, xtraining выйдет очень скоро.

Зачем всё это

Я всегда хотел иметь Читать полностью »

«Друзья не дают друзьям пользоваться Ollama» - 1

Ниже — перевод статьи «Friends Don’t Let Friends Use Ollama»Читать полностью »

Предыстория

Последние полгода с лишним я занимаюсь работой с LLM и созданием ИИ-персонажа. За это время я столкнулся с множеством проблем, решением которых хотел бы поделиться и, возможно, посоветоваться.

Кому подойдёт эта статья

  • Тем, кто хочет создавать прописанных персонажей для RP или ИИ-компаньонов

  • Энтузиастам, что хотят оживлять популярных персонажей из игр/комиксов/аниме

  • ИИ-энтузиастам

Начало опытов

Когда я только начал попытки создания своего пет-проекта с ИИ, я столкнулся с проблемой — вектор диалога меняется каждый ход и в конце концов становится неуправляемым.

Читать полностью »

Полгода назад я прикинул, сколько рабочих созвонов ежедневно улетает на чужие сервера через модные ИИ-ноутейкеры. Стало как-то неуютно. Otter, Granola, Fireflies — все льют разговоры в облако. Granola в этом году вообще отличилась: The Verge раскопали, что заметки по дефолту доступны любому по ссылке, а на пользовательских данных крутят модели (opt-out ожидаемо зарыт в Enterprise-тарифе).

Решил проверить, можно ли собрать ассистента целиком на своём железе. Спойлер: можно. Работает каждый день на M1 Max под Apache 2.0.

Что получилось

Читать полностью »

Об открытых языковых моделях написано много — и почти все статьи посвящены знакомству, в лучшем случае — «медовому месяцу» использования. Бенчмарки, рейтинги «лучших моделей года», полевые тесты на одной задаче, руководства. Гораздо реже говорят, что происходит потом: как ведет себя модель спустя месяцы непрерывной работы, где и почему начинает сбоить, что ломается под нагрузкой и какие инженерные решения постепенно вытесняют первоначальные представления о том, «как надо». 

В WB-TechЧитать полностью »

Дисклеймер: это не юридическая консультация. Я айтишник, к.т.н. и преподаватель ИТ-дисциплин, а не юрист. Ниже — взгляд практика, который учит сотрудников компаний работать с нейросетями и постоянно натыкается на эти вопросы вживую.

За последний год я провёл серию корпоративных тренингов по использованию ИИ для рабочих офисных задач — в разных по размеру компаниях. И очень часто в перерыве кто-нибудь из участников подходит и вполголоса спрашивает — «а ничего, что я договор с клиентом закидывал в ChatGPT, чтобы он мне выжимку сделал?»

Читать полностью »

Введение

В существующей системе мониторинга Oracle уже использовалось разработанное мной решение, которое с интервалом в 1 минуту собирало метрики производительности из представления V$WAITCLASSMETRIC и отображало их в Grafana. Графики наглядно показывали изменения времени ожиданий в классах User I/O, Commit, Concurrency и других, однако они показывали лишь сам факт изменения нагрузки, не объясняя его причины.

Читать полностью »

Недавно я делал учебный проект про автоматизацию документирования инцидентов. Поначалу планы были грандиозными: инциденты, таймлайны, интеграции с мониторингами, чатами, постмортемы, подсказки дежурным инженерам.

Но довольно быстро стало понятно, что с временными и ресурсными ограничениями лучше не пытаться написать маленький PagerDuty. Поэтому я сузил задачу до более реалистичного ядра: локального RAG-сервиса, который ищет по документации, ранбукам и коду, а затем передаёт найденный контекст в LLM.

Так появился llmortem — FastAPI-сервис, который можно подключить к OpenWebUI как OpenAI-compatible backend.

Читать полностью »

Поднимаем Llama 3 в облаке: Ollama и Open WebUI - 1

Локально запустить LLM сегодня можно за десять минут — например, с помощью LM Studio. Но как только модели нужно дать доступ команде, подключить RAG или встроить ее в сервис — такого подхода зачастую недостаточно.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js