Лента новостей

AIr/LocalLLaMA·30 июн. 2026 г., 15:55

🚀 Автономный pipeline сравнил локальный и облачный LLM Автор создал полностью автономный конвейер разработки и провёл прямое сравнение. Сначала проект был запущен на локальном 27‑млрд‑параметровом моделe, работающем на модифицированной видеокарте RTX 4090. Затем тот же проект выполнили на недорогих облачных языковых моделях.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:54

📚 PageStorm — модель для креативного написания книг Разработчики представили модель PageStorm, специально созданную для генерации литературных текстов. Она предназначена помогать авторам в процессе создания сюжетов, персонажей и стилистики произведений.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:52

🚀 TurboOCR v3: 520 изображений в секунду на RTX 5090 TurboOCR v3 — сервер распознавания текста в документах, реализованный на C++ с использованием CUDA. При тестировании на видеокарте RTX 5090 он достигает скорости около 520 изображений в секунду.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:51

🔊 Как запустить локальный TTS для немецкого текста? Вопрос: как осуществить локальный синтез речи (TTS) для текста на немецком языке?

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:47

📈 Тестирование каталога инструментов Я сравнил полный каталог инструментов с ранжированным на локальной модели. Точность работы выросла с 8 % до 77 %.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:46

🧠 Новый подход HydraHead от команды Qwen Команда Qwen представила исследование под названием HydraHead, в котором рассматривается функциональная гетерогенность на уровне голов модели. В работе предлагается переход от разнообразия функций голов к специализированным механизмам внимания, объединяя их в гибридную архитектуру. Это направление направлено на улучшение эффективности и гибкости нейронных сетей за счёт комбинирования разных типов внимания.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:45

🚀 Qwen 3.6 27B достигает ~100 TPS на RTX 3090 Модель Qwen 3.6 с 27 млрд параметров прошла тест со спекулятивным декодированием и показала около 100 токенов в секунду на одной видеокарте RTX 3090. Тест использовал метод спекулятивного декодирования, который ускоряет генерацию текста, и был выполнен на единственном GPU, демонстрируя высокую эффективность без необходимости в более мощных системах. ⚡

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:44

🔍 GLM 5.2 проверили в реальном проекте компьютерного зрения Разработчики протестировали модель GLM 5.2, запустив её в задаче многофайловой реализации компьютерного зрения. Тест показал, что модель способна работать в условиях, близких к производственной эксплуатации.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:43

🔍 Объяснение внимания с помощью синтеза программ Недавняя публикация «Explaining Attention with Program Synthesis» посвящена исследованию методов объяснения механизма внимания через синтез программ.

Источник ↗
AIr/LocalLLaMA·30 июн. 2026 г., 15:42

🛠️ Новый фильтр совместимости оборудования на Hugging Face Платформа Hugging Face добавила возможность фильтровать модели по требуемой аппаратной совместимости. Теперь в поиске можно сразу указать тип устройства — CPU, GPU или конкретные процессоры, и увидеть только те модели, которые работают на выбранном оборудовании. Эта функция упрощает подбор моделей для разработчиков, позволяя быстрее находить решения, подходящие под их технические ограничения.

Источник ↗