Лента новостей
🔧 Бюджетный ПК превратился в мульти‑GPU для инференса Автор модернизировал свою недорогую сборку, установив несколько видеокарт, чтобы повысить производительность при запуске моделей. Теперь система способна выполнять инференс быстрее, используя возможности параллельных вычислений.
Источник ↗⚡️ Конфигурация beta‑версии llama.cpp на 7900XTX Пользователь делится настройкой ежедневного бета‑выпуска llama.cpp Vulcan, работающего под Ubuntu на видеокарте 7900XTX. Инференс настроен на 262 k, используется модель qwen3.6‑35b‑a3b‑iq4_xs, объём памяти составляет около 22 k MiB. 🚀 Генерация токенов и их сжатие происходят в два раза быстрее, чем при оптимизированном ROCm 7.14, при этом требуемый объём памяти ниже.
Источник ↗🛠️ Llama.cpp неожиданно выгружает модель В репозитории llama.cpp зафиксировано, что модель иногда выгружается через несколько секунд работы. Проблема проявляется случайным образом, без видимых причин. Разработчики пока не уточнили причины и сроки исправления.
Источник ↗🚀 Nemotron‑3‑Super‑120B‑A12B достиг 504 К токенов Гибридная модель Mamba + MoE под названием Nemotron‑3‑Super‑120B‑A12B продемонстрировала идеальное извлечение «иглы» при работе с последовательностью до 504 000 токенов. Тесты проводились на четырёх видеокартах RTX 3090, что подтверждает её высокую эффективность при масштабных задачах обработки текста.
Источник ↗🔧 Vulkan теперь поддерживает TP В репозитории ggml‑org/llama.cpp открыт Pull Request #25051, автором которого является pwilkin. В изменениях реализована возможность использования Tensor Parallel (TP) в Vulkan. Это обновление делает TP практичным для проектов, использующих данную библиотеку.
Источник ↗🤖 Локальная LLM без ограничения контекста Новая локальная языковая модель поддерживает автономного, постоянно развивающегося персонажа, который больше не ограничен размером окна контекста. Разработчики отмечают, что модель сохраняет состояние персонажа, позволяя ему расти без необходимости перезапуска контекста. Кто‑то уже пробовал аналогичные решения?
Источник ↗🖥️ Microsoft построила суперкомпьютер для OpenAI, как утверждает NYT В статье New York Times говорится, что компания Microsoft создала суперкомпьютер, который, по их словам, используется OpenAI для обхода авторских прав. По заявлению издания, инфраструктура позволяет ускорять генерацию контента, что, по мнению NYT, способствует нарушению прав владельцев. Microsoft и OpenAI не комментируют обвинения. NYT не предоставляет подробных технических данных о мощности системы.
Источник ↗🚀 Local LLM Peeps Local LLM Peeps Local LLM Peeps
Источник ↗❓Вопрос о многомодельных бэкендах Сообщается, что интересует, какие решения используют для поддержки нескольких моделей в бэкенде. Также задаётся вопрос о том, как происходит замена конфигураций в подобных системах.
Источник ↗🛡️ Правительство США определит доступ к новейшему обновлению ChatGPT Согласно официальному заявлению, правительство США будет решать, какие организации и пользователи получат право использовать последнюю версию ChatGPT. Решение будет приниматься в рамках государственной политики по применению искусственного интеллекта; конкретные критерии пока не объявлены.
Источник ↗