Рубрика «tiktoken»

Если использовать нейросеть как «большой словарь токенов» для архиватора, то можно разработать архиватор с рекордным коэффициентом сжатия. Например, сейчас в мировом бенчмарке Large Text Compression Benchmark (LTCB) лидирует компрессор NNCP, в котором Фабрис Беллар реализовал примерно такую идею:

Читать полностью »

Результаты LTCB на текстовом корпусе enwik9 (первые 1 000 000 000 байт текста англоязычной Википедии — enwiki-20060303-pages-articles.xml, 4,7 ГБ), июнь 2026

Сейчас на фоне стремительной популяризации нейросетей, в России появилось достаточно много сервисов и агрегаторов, обеспечивающих удобный доступ к популярным языковым моделям без использования VPN. Однако при выборе подходящего решения мы зачастую сталкиваемся с проблемой разношерстной тарификация: у одних внутренняя валюта, у других стоимость за слова, третьи считают символы или количество токенов в запросе.

Читать полностью »

Эта статья про новое расширение ахритектуры трансформеров – Titan от Google –, позволяющее расширить рамки LLM до 2 млн токенов, побудила поинтересоваться, сколько токенов, пригодных для LLM, содержат исходники колоссального софта.

Какой открытый софт будем „препарировать“:


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js