Лента новостей
🛠️ Поддержка DFlash добавлена в llama.cpp В репозиторий проекта llama.cpp внесён новый код, реализующий поддержку DFlash. Теперь эта функция доступна пользователям проекта. Объединение кода происходит в основной ветке, что упрощает дальнейшее развитие и использование DFlash вместе с llama.cpp.
Источник ↗🧠 Что потребуется для создания собственного LLM в /r/localllama? На субреддите /r/localllama участники обсудили возможность разработки своей крупной языковой модели и задали вопрос о необходимых ресурсах. В обсуждении упомянули потребность в мощных GPU‑серверах (например, минимум 8 видеокарт) и больших наборах данных объёмом в терабайты, а также варианты использования открытых моделей в качестве основы. Пока точных цифр нет, диалог продолжается, и пользователи делятся опытом и ссылками на доступные инструменты.
Источник ↗🚀 Ornith-1.0 обгоняет Qwen 3.6 Модель Ornith‑1.0 с 9 млрд параметров показала лучшую результативность, чем Qwen 3.6 (35 млрд параметров), в ряде независимых бенчмарков. В тестах Ornith‑1.0 превзошла конкурента как по точности, так и по скорости обработки, несмотря на более компактный размер модели. 🏆
Источник ↗🤔 Стоит ли инвестировать в модели 70‑350 млрд параметров? В сообществе обсуждают, существуют ли надёжные рейтинги, сравнивающие закрытые и открытые LLM. Особый интерес вызывают крупные модели от 70 млрд до 350 млрд параметров: действительно ли они оправдывают затраты?
Источник ↗❓ Опрос о больших моделях Как многие из вас используют версии Q1 или Q2 крупных моделей с от 100 до 250 млрд параметров? Поделитесь, каковы ваши впечатления от работы с этими версиями.
Источник ↗🔎 Что используют компании для собственного AI Вопрос: какие технологии и решения применяют организации для развертывания искусственного интеллекта на собственных серверах и почему они делают такой выбор.
Источник ↗🖥️ Простой CPU‑инференс‑движок для Qwen 3 Создан минимальный движок инференса, работающий исключительно на центральном процессоре. ⚙️ Он предназначен для модели Qwen 3 и полностью написан с нуля на чистом C, без сторонних библиотек. Подходит для запуска модели без GPU и без сложных зависимостей.
Источник ↗🚀 Krea2 FP8 запущен на 8 ГБ видеопамяти На YouTube пользователь продемонстрировал работу модели Krea2 FP8 объёмом 13 ГБ, используя графический процессор с 8 ГБ видеопамяти. Это показывает, что модель может работать даже при ограниченных ресурсах видеопамяти. 👀
Источник ↗❓ Qwen3‑VL‑2B: единственная VLM для извлечения JSON на «картошке» В сообществе обсуждается, может ли модель Qwen3‑VL‑2B стать единственной пригодной визуально‑языковой моделью для получения JSON‑данных на устройствах с ограниченными ресурсами, условно названных «картошкой».
Источник ↗🔹 Новая модель Clark‑Air Sana 1.6B от Clark Labs на Hugging Face Clark Labs разместили на платформе Hugging Face свою последнюю языковую модель — Clark‑Air Sana 1.6B. Модель содержит 1,6 млрд параметров и использует 1,58‑bit представление данных.
Источник ↗