Лента новостей
🚫 MLB запретил iPad с ИИ в скамейке MLB официально запретил использовать iPad в скамейке для получения советов от искусственного интеллекта во время матча. По новому правилу тренеры и игроки больше не смогут обращаться к чат‑ботам за тактическими рекомендациями в реальном времени 🤖.
Источник ↗🚀 35‑млрд‑параметров Qwen 3.6 MoE на Xiaomi 12 Pro Пользователь Reddit https://www.reddit.com/r/LLM/s/IDUyU3v9ap и проект BigMoeOnEdge https://github.com/Helldez/BigMoeOnEdge позволили запустить модель Qwen 3.6 35B MoE (Q4_K_M) на смартфоне Xiaomi 12 Pro с 12 ГБ ОЗУ, названном «Zeus». Из‑за объёма памяти максимальный контекст ограничен 8192 токенами, но модель полностью работает локально без облака. 📊 В тесте генерация 107 токенов заняла 0.412 с/токен (2.428 токен/с). CPU загружен на 88.1 % (1.4508 cpu‑s/токен на 4 потоках), зафиксировано 51.93 мажорных сбоя/токен. Предзаполнение 24 токена потребовало 5.499 с (4.4 токен/с). Загрузка модели – 14.421 с, время до первого токена – 19.920 с. Поток MoE читал 14589.9 MiB (136.35 MiB/токен), декодирование 0.412 с/токен (вычисления 0.314 с, управление кэшем 0.014 с, flash‑I/O 0.382 с, скорость 357 MiB/s). Кеш MoE‑hit = 70.8 % (резидентный объём 2998.5 MiB), задержка из‑за наложения чтения flash и вычислений FFN = 0.084 с/токен.
Источник ↗🏛️ Нью-Джерси запретил алгоритмическое ценообразование аренды Губернатор Шеррилл подписал закон FAIR Act, который ограничивает использование алгоритмов, устанавливающих арендную плату на основе непубличных данных арендодателей. Закон направлен против программного обеспечения, собирающего сведения о сдаче и заполняемости квартир от разных собственников, и запрещает их применение в ценовой политике.
Источник ↗🖥️ DeepSeek V4 Flash ≈ 105 токенов/сек на двух RTX 4090d (48 ГБ) в vLLM 🚀 Автор переписал все ядра, ранее доступные только для Blackwell (DeepGEMM, FlashInfer sparse‑MLA, block‑scaled FP8), в Triton, поскольку для sm89 их нет. Это дало 2‑3‑кратный прирост производительности в параллельных агентных задачах. Тесты проведены на Dell R740 с двумя видеокартами Nvidia RTX 4090d 48 ГБ, используя p2p‑патч (GitHub/Duanyll/open‑gpu‑kernel‑modules). В vLLM модель DeepSeek‑V4‑Flash была сжата до формата ~iq2, чтобы уместиться в 96 ГБ видеопамяти; процесс занял до 60 минут. После сборки образа vLLM‑Moet (Dockerfile.sm89‑v0251) и запуска с параметрами TP=2, GPUS="device=0,1" получен контекст 262 k токенов и лучшая конкуренция по сравнению с llama.cpp. При однопроцессорном запуске можно задать TP=1 и GPUS="device=0". Автор считает, что дальнейшее улучшение производительности возможно, но текущий способ позволяет полностью загрузить модель в vLLM, чего не удалось достичь с llama.cpp.
Источник ↗🚀 AntLing‑3.0‑flash теперь доступен на OpenRouter AntLing‑3.0‑flash — гибридно‑рассуждающая MoE‑модель, разработанная для агентных систем промышленного масштаба. Модель уже запущена на платформе OpenRouter и доступна бесплатно до 3 августа 2026 года. Разработчики планируют открыть её весовые параметры в ближайшее время.
Источник ↗🚀 AntLing‑3.0‑flash запущен на OpenRouter и будет бесплатным до 3 августа 2026 г. Сервис уже доступен пользователям через платформу OpenRouter. Бесплатный доступ будет действовать до 3 августа 2026 года, после чего условия могут измениться. Подробнее: https://openrouter.ai/inclusionai/ling-3.0-flash
Источник ↗⚡ CPU‑инференс на Celeron N5095: 6 моделей от 0.6B до 8B Тест проведён на одноплатном компьютере Youyeetoo X1S (Celeron N5095, 4 ядра/4 потока, 15 Вт, 16 ГБ ОЗУ, 128 ГБ NVMe, Kali 2025.4). Базовая конфигурация стоит $100‑$130 на AliExpress. Ollama обнаружил встроенный iGPU, но автоматически переключился на процессор, поэтому измерения выполнены только на CPU. Модель Qwen3 0.6B достигла 6.788 токенов/с — скорость, пригодная для интерактивных задач (классификация, маршрутизация, суммирование). Модель 8B поместилась в 16 ГБ, но работала лишь 0.924 токенов/с, что делает её непрактичной; ограничивает её пропускная способность памяти, а не объём. Между ними есть четыре модели, полная таблица в репозитории. При 15‑минутной нагрузке температура в среднем 74.66 °C, пик 77 °C, без троттлинга на штатном радиаторе и вентиляторе. Дальше планируется сравнение CPU и Vulkan‑инференса с помощью llama.cpp на iGPU Jasper Lake; результаты будут опубликованы. Скрипты, логи и полные данные доступны на GitHub, а подробный обзор — на сайте автора. (Борд предоставил Youyeetoo, выводы авторские.)
Источник ↗🚀 Apple M5 не использует полностью возможности матричных ядер Сейчас в MLX и Llama.cpp для macOS активируются 16‑битные данные, хотя чипы поколения M5 поддерживают INT8‑активации (тип w4a8). Поддержка INT8 реализована, но пока ни один инференс‑бэкенд её не использует. Автор создал собственные ядра w8a8 и добился ускорения 1.4× на задачах предзаполнения модели Gemma4. На M5 MacBook Air базовый показатель предзаполнения E2B вырос с 2193 tps до 3029 tps при обработке 130 173 токенов; при небольших контекстах скорость приближается к 10 000 tps. 😊
Источник ↗📱 Samsung усиливает AI в новых Galaxy Новые смартфоны серии Galaxy от Samsung будут активно использовать искусственный интеллект, встроенный в процессоры Qualcomm Snapdragon. Компания заявила, что AI‑функции, поддерживаемые Snapdragon, станут ключевой частью работы устройств.
Источник ↗🚗 Шеф Mobileye Амнон Шашуа переходит в роль председателя совета Amnon Shashua, генеральный директор Mobileye, объявил о своём уходе с поста CEO. Компания усиливает работу в направлениях роботакси и робототехники. Шашуа получил приглашение занять место председателя совета директоров.
Источник ↗