Лента новостей
🚀 Тест PrismaQuant на RTX Pro 4500 Проведено тестирование новых моделей Qwen 3.6 27B, квантизированных методом PrismaQuant (NVFP4 и INT4 Autoround), на системе с RTX Pro 4500 32 ГБ и Oculink (Beelink SER 8 8745 HS, AooStar eg01). Проблемы с моделью Sakamakismile (ошибки вызова инструментов, зацикливание) в vLLM 0.22‑0.24 подтолкнули к поиску альтернативных квантизаций. PrismaQuant, обсуждаемый на форуме Nvidia DGX Spark, автоматически выбирает оптимальный формат для каждого линейного слоя, но работает только в vLLM для архитектуры Blackwell (серии 50, RTX Pro) и пока не поддерживает GGUF. В репозитории доступны модели: - **Qwen3.6‑27B‑PrismaSCOUT‑Blackwell‑NVFP4‑BF16‑vllm** ≈ 5.31 бит, ≈ 20 ГБ; - **Qwen3.6‑27B‑PrismaAURA‑5.5bit‑vllm** ≈ 5.5 бит, ≈ 23 ГБ; - **Qwen3.6‑27B‑PrismaQuant‑Heretic‑5.25bit‑vllm** ≈ 5.249 бит, ≈ 22 ГБ (не тестировалась). Запуск моделей осуществлялся через Docker‑контейнеры vLLM 0.24 с набором параметров (flashinfer‑cutlass, fp8‑kv‑cache, compressed‑tensors и др.). Для PrismaAURA из‑за большего объёма весов (на 2 ГБ) длина контекста ограничена 150 К токенов, тогда как PrismaSCOUT поддерживает до 210 К. Результаты KLD: PrismaAURA 0.0342 vs PrismaSCOUT 0.05508. При тестах llama‑benchy (контекст ≤ 210 К) производительность составила: - Sakamakismile (NVFP4 W4A4) PP ≈ 5 789 токен/с, TG ≈ 71.6 токен/с; - PrismaSCOUT (NVFP4 + BF16) PP ≈ 4 988 токен/с, TG ≈ 70.2 токен/с. Метод PrismaQuant демонстрирует более низкое отклонение KL и стабильную работу в пределах поддерживаемой архитектуры.
Источник ↗🚨 Grok Build CLI передаёт весь репозиторий в облако xAI Исследование, проведённое через mitmproxy, показало, что утилита Grok Build CLI версии 0.2.93 отправляет весь ваш репозиторий, включая полную историю Git, в Google Cloud xAI, независимо от того, какие файлы вы открываете. Несмотря на запрос «не читать и не открывать файлы», в загруженный git‑bundle попал специально помещённый файл, который можно восстановить командой git clone -d. Утилита также передаёт прочитанные файлы, в том числе .env с переменными API_KEY и DB_PASSWORD, на сервер cli‑chat‑proxy.grok.com без изменений. Отключение опции «Improve the model» не останавливает передачу — эта настройка влияет только на обучение модели. Полный протокол, SHA‑256 и команды воспроизведения доступны по ссылке: https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547
Источник ↗📊 Новые наборы GGUF‑квантов от Tencent и NVIDIA В репозиториях опубликованы два набора GGUF‑квантов с одинаковой обработкой: иматричная квантизация, измерения KLD/PPL относительно BF16‑логитов, показатели производительности в llama‑bench и полный набор исходных данных. Все цифры воспроизводимы из файлов репозитория, без заявлений о «качестве». **Hy3** – 295‑млрд параметров MoE от Tencent (21 млрд активных), контекст 262 К, лицензия Apache 2.0. Кванты: Q6_K – 226 ГиБ, KLD 0.0207, совпадение топ‑токенов 95.1 %, 57.4 токенов/с; Q4_K_M – 167 ГиБ, KLD 0.0904, 90.0 %, 67.3 ток/с; Q3_K_L – 143 ГиБ, KLD 0.1624, 86.8 %, 63.3 ток/с; IQ2_M – 90 ГиБ, KLD 0.5314, 74.7 %, 78.7 ток/с. Тесты проведены на 8 × RTX PRO 6000 Blackwell (layer split, F16 KV‑cache) по WikiText‑2. Q6_K почти без потерь при ≈256 ГБ памяти, Q4_K_M подходит для двух 96 ГБ GPU, IQ2_M помещается в один 96 ГБ GPU или 128 ГБ Mac, но с заметным падением качества. Требуется запуск с --split-mode layer; блоки MTP/NextN исключены. **Nemotron‑Labs‑Audex‑30B‑A3B** – гибридный MoE‑модель NVIDIA (30 млрд параметров, ~3 млрд активных на токен), контекст 1 млн, поддержка аудио. В репозитории два трека: text‑only GGUF и full‑vocab аудиогенерация с дополнительным sidecar (NV‑Whisper, декодер речи, VAE и скрипты HF/vLLM). Качество проверено на WikiText‑2, код и GSM8K; производительность измерена на 2 × RTX PRO 6000 Max‑Q. Текстовые кванты: Q8_0 – 31.3 ГиБ, KLD 0.0056, 97.0 % совпадения, 287 ток/с; Q5_K_M – 24.2 ГиБ, KLD 0.0127, 95.5 %, 334 ток/с; Q4_K_M – 22.8 ГиБ, KLD 0.0180, 94.7 %, 345 ток/с; MXFP4_MOE – 16.7 ГиБ, KLD 0.0405, 92.3 %, 329 ток/с. BF16 даёт ~177 ток/с, поэтому кванты работают почти в 2 раза быстрее. MXFP4_MOE экспериментален, но даёт самый маленький файл и 11.5 к токенов в запросе. Лицензия — NVIDIA OneWay Noncommercial, коммерческое использование запрещено. Для работы LM используется llama.cpp, полный аудио‑поток требует sidecar и скриптов NVIDIA; единого аудио‑GGUF‑рантайма пока нет. ~133 из 401 тензора не квантизированы, что объясняет размер Q6_K, близкий к Q8_0. В репозиториях есть графики, контрольные суммы, планы квантизации и логи.
Источник ↗🧩 Полный декодер GPT‑2 открыт Представлен BABEL‑codec — первый полностью сертифицированный декодер, позволяющий читать внутреннее состояние модели GPT‑2 small и записывать английский обратно. 🤖 При тестировании удалось восстановить 94,7 % поведения модели; результат сохраняется на всех уровнях слоёв и в разных текстовых режимах, а не только в одной точке. Все материалы опубликованы открыто: статья, полный лексикон, таблицы грамматики, веса кодера‑декодера, скрипты воспроизводства и демо‑интерфейс, где можно увидеть «мысли» модели по любой введённой фразе. https://github.com/wpferrell/babel-codec-gpt2
Источник ↗🤖 AI автоматизирует определение говорящих в звонках Новая система искусственного интеллекта способна автоматически распознавать всех участников разговора по транскрипции: оператора, клиента, IVR и любые многоголосые реплики. После диаризации каждый звонок оценивается, проверяется на соответствие требованиям и превращается в материал для обучения персонала без участия человека.
Источник ↗🚫 Meta убирает функцию Muse Image AI Meta объявила о прекращении работы функции Muse Image AI, объяснив решение тем, что она не обеспечивает достаточный уровень конфиденциальности пользователей. Функция была запущена во вторник и позволяла автоматически генерировать изображения, используя контент из публичных аккаунтов Instagram. На её работу сразу же поступила критика за возможные нарушения приватности. После отзыва компания заявила, что будет искать альтернативные решения, соответствующие требованиям защиты данных.
Источник ↗🚪 Руководитель отдела безопасности OpenAI уходит OpenAI объявила об уходе Йоханнеса Хайдека, возглавлявшего её отдел безопасности. Отход происходит в момент, когда компания работает над более тесной интеграцией исследовательских и безопасностных команд. 🔧 Это шаг, направленный на согласование разработки ИИ с требованиями безопасности.
Источник ↗🌐 ООН запускает инициативу по доверию к ИИ‑агентам Цифровое агентство ООН объявило о новой программе, направленной на повышение доверия к автономным ИИ‑системам, которые действуют от имени пользователей. В рамках инициативы будет создана фокус‑группа, разрабатывающая стандарты идентификации и надёжности ИИ‑агентов, чтобы предотвратить их использование для имитации людей и принятия несанкционированных решений. Группа также будет контролировать, чтобы в чувствительных операциях сохранялся реальный человеческий контроль. 🚀
Источник ↗🚀 Китайская AI‑платформа для кино и ТВ вызывает споры Запущена в Китае новая платформа, использующая искусственный интеллект для профессионального производства фильмов и телепрограмм. Сервис формирует «талант‑пул» из цифровых моделей, созданных на основе данных реальных актёров, что вызвало критику из‑за вопросов о правомерности и этике их использования.
Источник ↗⚡️ Замена Qwen3.6‑27B INT8 на NVFP4 на 2 × 3090 Тесты показали одинаковое качество генерации, но почти вдвое увеличенный KV‑пул. При MTP n=3 модель достигает 104 токена/с в однопоточном режиме и 193 токена/с в агрегированном режиме при кодировании, при этом уровень принятия черновика составляет 88‑90 %. Конфигурация: 2 × 3090 (ограничение 200 Вт), vLLM 0.22.1, TP=2, fp8 KV, контекст 151 K. Размер весов сократился с 16.9 GiB/карта (INT8) до 10.4 GiB (NVFP4). KV‑пул вырос с 1 потока при 151 K до 3 потоков, проверено реальными заполнениями 144 K. Скорость декодирования при MTP n=3 варьируется 90‑104 т/с в зависимости от нагрузки; приемлемость — 66 % проза, 90 % жадный код. Качество: оценка tool‑call совпала, canon‑recall слегка в пользу NVFP4, регрессий не обнаружено. На одной карте 24 GB модель не помещается: весы 19.99 GiB оставляют лишь ‑0.05 GiB для KV при любом контексте. Квантование смешанное (половина линейных слоёв остаётся FP8, embed и vision — bf16). vLLM 0.22.1 не может загрузить модель из‑за квантования lm_head; требуется пять небольших правок или nightly‑версия. Утверждение unsloth о 2.5‑кратном ускорении относится к NVFP4 на vLLM 0.24 с CUTLASS‑ядрами FP4 и не переносится на Ampere, где всё проходит через Marlin dequant. При этом модель NVFP4 размером 23.4 GB хуже по однокарточной производительности. Чистый W4A4 NVFP4 работает на 1.7‑1.9 раз медленнее, чем смешанный W4A16/FP8 от NVIDIA. Подробнее в дашборде: https://github.com/NHClimber87/llm-serve-dashboard
Источник ↗