Лента новостей

AIr/technology·11 июл. 2026 г., 01:38

🚀 Китайская AI‑платформа для кино и ТВ вызывает споры Запущена в Китае новая платформа, использующая искусственный интеллект для профессионального производства фильмов и телепрограмм. Сервис формирует «талант‑пул» из цифровых моделей, созданных на основе данных реальных актёров, что вызвало критику из‑за вопросов о правомерности и этике их использования.

Источник ↗
AIr/LocalLLaMA·11 июл. 2026 г., 01:28

⚡️ Замена Qwen3.6‑27B INT8 на NVFP4 на 2 × 3090 Тесты показали одинаковое качество генерации, но почти вдвое увеличенный KV‑пул. При MTP n=3 модель достигает 104 токена/с в однопоточном режиме и 193 токена/с в агрегированном режиме при кодировании, при этом уровень принятия черновика составляет 88‑90 %. Конфигурация: 2 × 3090 (ограничение 200 Вт), vLLM 0.22.1, TP=2, fp8 KV, контекст 151 K. Размер весов сократился с 16.9 GiB/карта (INT8) до 10.4 GiB (NVFP4). KV‑пул вырос с 1 потока при 151 K до 3 потоков, проверено реальными заполнениями 144 K. Скорость декодирования при MTP n=3 варьируется 90‑104 т/с в зависимости от нагрузки; приемлемость — 66 % проза, 90 % жадный код. Качество: оценка tool‑call совпала, canon‑recall слегка в пользу NVFP4, регрессий не обнаружено. На одной карте 24 GB модель не помещается: весы 19.99 GiB оставляют лишь ‑0.05 GiB для KV при любом контексте. Квантование смешанное (половина линейных слоёв остаётся FP8, embed и vision — bf16). vLLM 0.22.1 не может загрузить модель из‑за квантования lm_head; требуется пять небольших правок или nightly‑версия. Утверждение unsloth о 2.5‑кратном ускорении относится к NVFP4 на vLLM 0.24 с CUTLASS‑ядрами FP4 и не переносится на Ampere, где всё проходит через Marlin dequant. При этом модель NVFP4 размером 23.4 GB хуже по однокарточной производительности. Чистый W4A4 NVFP4 работает на 1.7‑1.9 раз медленнее, чем смешанный W4A16/FP8 от NVIDIA. Подробнее в дашборде: https://github.com/NHClimber87/llm-serve-dashboard

Источник ↗
AIr/LocalLLaMA·11 июл. 2026 г., 01:27

🖥️ Новый открытый дашборд для локального LLM‑сервера Разработчик представил одностраничный, полностью независимый от библиотек дашборд, отображающий состояние вашего локального сервера LLM в режиме реального времени. Интерфейс — одна зелёная терминальная страница, открывается через file://, а бекенд — один файл на чистом Python, читающий nvidia‑smi и метрики Prometheus. 🛠️ На экране показываются загрузка каждой видеокарты, объём VRAM, потребляемая мощность, температура, частоты и текущие вычислительные задачи (полученные из nvidia‑smi --query‑compute‑apps). Для основного воркера выводятся токены/сек, количество запросов, заполнение контекста/KV и используемые LoRA‑адаптеры. Поддержка llama.cpp ( /metrics + /props ) и vLLM ( /metrics + /v1/models ) с автоматическим определением порта. Дополнительно можно добавить вторичные серверы через переменную SECONDARY_SERVERS, отображаются системные метрики CPU, RAM, нагрузка, сеть и диск, а также библиотека моделей с информацией о квантизации, контексте и измеренной пропускной способности, управляемая JSON‑реестром. Опциональная панель «reasoning tap» выводит цепочку рассуждений модели, если её лог включён. Проект доступен на GitHub: https://github.com/NHClimber87/llm-serve-dashboard. Автор просит попробовать инструмент и задавать вопросы — это помогает улучшать наблюдаемость, особенно при работе с дистилляцией учительских моделей.

Источник ↗
AIr/LocalLLaMA·11 июл. 2026 г., 01:22

🚀 Tencent‑HY3: 295‑млн‑параметров на 128 ГБ Tencent представила модель HY3 (295B‑A21B MoE) — новый открытый весовой LLM, размер которого сопоставим с DeepSeek v4 Flash, но показывает лучшие результаты в бенчмарках. Для тестов использовался MacBook M5 Max с 128 ГБ ОЗУ, где был установлен quant‑файл UD128 (107 ГБ) — единственный с опубликованными показателями perplexity. Установка прошла через PR #25395 в репозитории llama.cpp, с включённой поддержкой Metal и увеличенным лимитом видеопамяти до 122 ГБ (по умолчанию 96 ГБ). После небольшого исправления названия архитектуры (замена “hy‑v3” на “hy_v3” в 21 файле GGUF) модель загрузилась за ~30 секунд, и WebUI открылся без ошибок. Бенчмарк на M5 Max (llama‑bench, q8_0, без MTP) показал: предзаполнение pp512 при пустом контексте 528 токенов/сек, декодирование tg128 — 32.4 ток/сек; при 16 К контексте 124 ток/сек (prefill) и 16.3 ток/сек (decode). Скорость генерации токенов вдвое превышает DeepSeek v4 Flash при схожем качестве. С включённым MTP (вариант n=2) достигнут пик 38 токенов/сек, что даёт прирост ≈ 19 % и сравнимо с Qwen 3.6‑27B‑MTP. Автор отмечает, что модель отлично справляется с обычными запросами и базовыми инструментами, используется для исследований в ML через HF MCP и CLI, и приглашает коллег протестировать HY3 и поделиться результатами.

Источник ↗
AIr/LocalLLaMA·11 июл. 2026 г., 01:07

🚀 Новая 7B‑модель HiLS‑Attention от Tencent Tencent разместил на Hugging Face модель HiLS‑Attention‑7B — механизм разреженного внимания по чанкам, обучаемый энд‑туп‑энд под задачей предсказания следующего токена, что позволяет эффективно работать с длинными контекстами. Модель построена на базе OLMo3‑7B, дообучена и содержит около 7 млрд параметров. В статье «Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling» (arXiv 2607.02980) описан подход: вместо полного вычисления QK используются сжатые ключи чанков для оценки их «массы», а внимание делится на меж‑ и внутричанковое softmax. Код и чекпоинт доступны в репозитории на GitHub и Hugging Face. Это предварительно обученная базовая модель без выравнивания и безопасностных настроек; она может сохранять предвзятости и генерировать неточный или небезопасный контент, поэтому пользователи должны самостоятельно оценивать её пригодность.

Источник ↗
AIr/technology·11 июл. 2026 г., 01:04

📈 Выбросы Microsoft выросли на 25 % за год В результате строительства дата‑центров, управляемых искусственным интеллектом, компания за последний год увеличила свои выбросы парниковых газов на четверть. Microsoft заявляет о желании поддерживать экологию, однако одновременно активно развивает и внедряет ИИ‑технологии, что создает внутренний конфликт между экологическими целями и продвижением ИИ.

Источник ↗
AIr/technology·11 июл. 2026 г., 01:01

💰 Долг крупнейших технологических компаний удвоился до $350 млрд Пять гиперскейлеров увеличили общий долг до $350 млрд, что вдвое больше, чем годом ранее. Одновременно они объявили о планах вложить $725 млрд в развитие искусственного интеллекта 🤖. Аналитики отмечают, что пока неясно, окупятся ли такие инвестиции.

Источник ↗
AIr/technology·11 июл. 2026 г., 00:54

🚫 Meta убрала функцию AI‑изображений в Instagram На этой неделе Meta AI запустила возможность создавать изображения с помощью ИИ на основе публичных постов в Instagram. Функция позволяла пользователям генерировать картинки, используя контент из открытых профилей, но сразу вызвала споры из‑за установленного по умолчанию режима. В ответ на критику компания решила отключить эту опцию, полностью удалив её из сервиса.

Источник ↗
AITechCrunch·10 июл. 2026 г., 23:56

🚫 Meta убирает спорную AI‑функцию в Instagram Meta решила отключить новую AI‑функцию после широкой негативной реакции пользователей. По словам Дилана Байерса из Puck News, компания подтвердила, что удаление функции было вызвано обратной связью аудитории.

Источник ↗
AIr/technology·10 июл. 2026 г., 22:15

📜 Apple подала иск к OpenAI о краже коммерческих тайн Компания Apple возбудила судебный процесс против OpenAI, обвиняя её в присвоении конфиденциальных материалов, полученных от бывших сотрудников Apple. 🛡️ В иске Apple утверждает, что OpenAI систематически использует её коммерческие тайны и закрытую информацию, нарушая права компании.

Источник ↗