Лента новостей

AIr/LocalLLaMA·26 июн. 2026 г., 22:47

🔧 Бюджетный ПК превратился в мульти‑GPU для инференса Автор модернизировал свою недорогую сборку, установив несколько видеокарт, чтобы повысить производительность при запуске моделей. Теперь система способна выполнять инференс быстрее, используя возможности параллельных вычислений.

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:46

⚡️ Конфигурация beta‑версии llama.cpp на 7900XTX Пользователь делится настройкой ежедневного бета‑выпуска llama.cpp Vulcan, работающего под Ubuntu на видеокарте 7900XTX. Инференс настроен на 262 k, используется модель qwen3.6‑35b‑a3b‑iq4_xs, объём памяти составляет около 22 k MiB. 🚀 Генерация токенов и их сжатие происходят в два раза быстрее, чем при оптимизированном ROCm 7.14, при этом требуемый объём памяти ниже.

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:45

🛠️ Llama.cpp неожиданно выгружает модель В репозитории llama.cpp зафиксировано, что модель иногда выгружается через несколько секунд работы. Проблема проявляется случайным образом, без видимых причин. Разработчики пока не уточнили причины и сроки исправления.

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:44

🚀 Nemotron‑3‑Super‑120B‑A12B достиг 504 К токенов Гибридная модель Mamba + MoE под названием Nemotron‑3‑Super‑120B‑A12B продемонстрировала идеальное извлечение «иглы» при работе с последовательностью до 504 000 токенов. Тесты проводились на четырёх видеокартах RTX 3090, что подтверждает её высокую эффективность при масштабных задачах обработки текста.

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:43

🔧 Vulkan теперь поддерживает TP В репозитории ggml‑org/llama.cpp открыт Pull Request #25051, автором которого является pwilkin. В изменениях реализована возможность использования Tensor Parallel (TP) в Vulkan. Это обновление делает TP практичным для проектов, использующих данную библиотеку.

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:42

🤖 Локальная LLM без ограничения контекста Новая локальная языковая модель поддерживает автономного, постоянно развивающегося персонажа, который больше не ограничен размером окна контекста. Разработчики отмечают, что модель сохраняет состояние персонажа, позволяя ему расти без необходимости перезапуска контекста. Кто‑то уже пробовал аналогичные решения?

Источник ↗
AIr/technology·26 июн. 2026 г., 22:38

🖥️ Microsoft построила суперкомпьютер для OpenAI, как утверждает NYT В статье New York Times говорится, что компания Microsoft создала суперкомпьютер, который, по их словам, используется OpenAI для обхода авторских прав. По заявлению издания, инфраструктура позволяет ускорять генерацию контента, что, по мнению NYT, способствует нарушению прав владельцев. Microsoft и OpenAI не комментируют обвинения. NYT не предоставляет подробных технических данных о мощности системы.

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:37

🚀 Local LLM Peeps Local LLM Peeps Local LLM Peeps

Источник ↗
AIr/LocalLLaMA·26 июн. 2026 г., 22:35

❓Вопрос о многомодельных бэкендах Сообщается, что интересует, какие решения используют для поддержки нескольких моделей в бэкенде. Также задаётся вопрос о том, как происходит замена конфигураций в подобных системах.

Источник ↗
AIr/technology·26 июн. 2026 г., 22:33

🛡️ Правительство США определит доступ к новейшему обновлению ChatGPT Согласно официальному заявлению, правительство США будет решать, какие организации и пользователи получат право использовать последнюю версию ChatGPT. Решение будет приниматься в рамках государственной политики по применению искусственного интеллекта; конкретные критерии пока не объявлены.

Источник ↗