Лента новостей
🚀 Запуск GPT‑5.6 и новости индустрии ИИ OpenAI 9 июля публично представила семейство моделей GPT‑5.6 после ограниченного предпросмотра партнёров: Sol (передовой уровень рассуждений), Terra (производительность прежнего флагмана при почти вдвое меньшей стоимости) и Luna (быстрая и дешёвая). Кроме того, вышли голосовая модель GPT‑Live‑1 с полным дуплексом и gpt‑realtime‑2.1, у которой задержка p95 снизилась примерно на 25 %. xAI анонсировала Grok 4.5 (обучалась совместно с Cursor) по цене 2 USD за млн входных токенов и 6 USD за млн выходных, заявив Opus‑классную эффективность в задачах программирования, юридических и финансовых расчётов. Google отложил выпуск Gemini 3.5 Pro до 17 июля, объявив о полном пересмотре архитектуры и поддержке контекста до 2 млн токенов. За неделю ушли четыре старших исследователя DeepMind (Shazeer в OpenAI, Jumper, Adler и Pritzel в Anthropic), а рыночная капитализация Alphabet упала примерно на 225 млрд USD. Microsoft планирует объединить все приложения Copilot в одно к августу; менее 4,5 % из 450 млн лицензий M365 уже перешли на платный Copilot. Meta выпустила Muse Image — первую модель Superintelligence Labs, генерирующую изображения с использованием поиска и кода, обученную на публичных фото Instagram (можно отключить). Ollama привлекла 65 млн USD в раунде Series B, обслуживая 8,9 млн разработчиков в месяц; Gemma 4 стала примерно на 90 % быстрее на Apple Silicon благодаря предсказанию нескольких токенов. 🛠️ DeepSeek объявил о завершении работы сервисов deepseek‑chat и deepseek‑reasoner 24 июля; при миграции следует учитывать, что deepseek‑reasoner переходит в режим v4‑flash, а для тяжёлых рассуждений рекомендуется использовать v4‑pro.
Источник ↗🚫 Meta убирает AI‑функцию в Instagram На этой неделе Meta запустила новую возможность, позволяющую пользователям изменять изображения в Instagram с помощью искусственного интеллекта. Через несколько дней после релиза сервис вызвал резкую критику, и компания приняла решение отключить функцию. Отзывчивость показала, что пользователи и эксперты выразили опасения по поводу манипуляций изображениями.
Источник ↗🚀 Тест PrismaQuant на RTX Pro 4500 Проведено тестирование новых моделей Qwen 3.6 27B, квантизированных методом PrismaQuant (NVFP4 и INT4 Autoround), на системе с RTX Pro 4500 32 ГБ и Oculink (Beelink SER 8 8745 HS, AooStar eg01). Проблемы с моделью Sakamakismile (ошибки вызова инструментов, зацикливание) в vLLM 0.22‑0.24 подтолкнули к поиску альтернативных квантизаций. PrismaQuant, обсуждаемый на форуме Nvidia DGX Spark, автоматически выбирает оптимальный формат для каждого линейного слоя, но работает только в vLLM для архитектуры Blackwell (серии 50, RTX Pro) и пока не поддерживает GGUF. В репозитории доступны модели: - **Qwen3.6‑27B‑PrismaSCOUT‑Blackwell‑NVFP4‑BF16‑vllm** ≈ 5.31 бит, ≈ 20 ГБ; - **Qwen3.6‑27B‑PrismaAURA‑5.5bit‑vllm** ≈ 5.5 бит, ≈ 23 ГБ; - **Qwen3.6‑27B‑PrismaQuant‑Heretic‑5.25bit‑vllm** ≈ 5.249 бит, ≈ 22 ГБ (не тестировалась). Запуск моделей осуществлялся через Docker‑контейнеры vLLM 0.24 с набором параметров (flashinfer‑cutlass, fp8‑kv‑cache, compressed‑tensors и др.). Для PrismaAURA из‑за большего объёма весов (на 2 ГБ) длина контекста ограничена 150 К токенов, тогда как PrismaSCOUT поддерживает до 210 К. Результаты KLD: PrismaAURA 0.0342 vs PrismaSCOUT 0.05508. При тестах llama‑benchy (контекст ≤ 210 К) производительность составила: - Sakamakismile (NVFP4 W4A4) PP ≈ 5 789 токен/с, TG ≈ 71.6 токен/с; - PrismaSCOUT (NVFP4 + BF16) PP ≈ 4 988 токен/с, TG ≈ 70.2 токен/с. Метод PrismaQuant демонстрирует более низкое отклонение KL и стабильную работу в пределах поддерживаемой архитектуры.
Источник ↗🚨 Grok Build CLI передаёт весь репозиторий в облако xAI Исследование, проведённое через mitmproxy, показало, что утилита Grok Build CLI версии 0.2.93 отправляет весь ваш репозиторий, включая полную историю Git, в Google Cloud xAI, независимо от того, какие файлы вы открываете. Несмотря на запрос «не читать и не открывать файлы», в загруженный git‑bundle попал специально помещённый файл, который можно восстановить командой git clone -d. Утилита также передаёт прочитанные файлы, в том числе .env с переменными API_KEY и DB_PASSWORD, на сервер cli‑chat‑proxy.grok.com без изменений. Отключение опции «Improve the model» не останавливает передачу — эта настройка влияет только на обучение модели. Полный протокол, SHA‑256 и команды воспроизведения доступны по ссылке: https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547
Источник ↗📊 Новые наборы GGUF‑квантов от Tencent и NVIDIA В репозиториях опубликованы два набора GGUF‑квантов с одинаковой обработкой: иматричная квантизация, измерения KLD/PPL относительно BF16‑логитов, показатели производительности в llama‑bench и полный набор исходных данных. Все цифры воспроизводимы из файлов репозитория, без заявлений о «качестве». **Hy3** – 295‑млрд параметров MoE от Tencent (21 млрд активных), контекст 262 К, лицензия Apache 2.0. Кванты: Q6_K – 226 ГиБ, KLD 0.0207, совпадение топ‑токенов 95.1 %, 57.4 токенов/с; Q4_K_M – 167 ГиБ, KLD 0.0904, 90.0 %, 67.3 ток/с; Q3_K_L – 143 ГиБ, KLD 0.1624, 86.8 %, 63.3 ток/с; IQ2_M – 90 ГиБ, KLD 0.5314, 74.7 %, 78.7 ток/с. Тесты проведены на 8 × RTX PRO 6000 Blackwell (layer split, F16 KV‑cache) по WikiText‑2. Q6_K почти без потерь при ≈256 ГБ памяти, Q4_K_M подходит для двух 96 ГБ GPU, IQ2_M помещается в один 96 ГБ GPU или 128 ГБ Mac, но с заметным падением качества. Требуется запуск с --split-mode layer; блоки MTP/NextN исключены. **Nemotron‑Labs‑Audex‑30B‑A3B** – гибридный MoE‑модель NVIDIA (30 млрд параметров, ~3 млрд активных на токен), контекст 1 млн, поддержка аудио. В репозитории два трека: text‑only GGUF и full‑vocab аудиогенерация с дополнительным sidecar (NV‑Whisper, декодер речи, VAE и скрипты HF/vLLM). Качество проверено на WikiText‑2, код и GSM8K; производительность измерена на 2 × RTX PRO 6000 Max‑Q. Текстовые кванты: Q8_0 – 31.3 ГиБ, KLD 0.0056, 97.0 % совпадения, 287 ток/с; Q5_K_M – 24.2 ГиБ, KLD 0.0127, 95.5 %, 334 ток/с; Q4_K_M – 22.8 ГиБ, KLD 0.0180, 94.7 %, 345 ток/с; MXFP4_MOE – 16.7 ГиБ, KLD 0.0405, 92.3 %, 329 ток/с. BF16 даёт ~177 ток/с, поэтому кванты работают почти в 2 раза быстрее. MXFP4_MOE экспериментален, но даёт самый маленький файл и 11.5 к токенов в запросе. Лицензия — NVIDIA OneWay Noncommercial, коммерческое использование запрещено. Для работы LM используется llama.cpp, полный аудио‑поток требует sidecar и скриптов NVIDIA; единого аудио‑GGUF‑рантайма пока нет. ~133 из 401 тензора не квантизированы, что объясняет размер Q6_K, близкий к Q8_0. В репозиториях есть графики, контрольные суммы, планы квантизации и логи.
Источник ↗🧩 Полный декодер GPT‑2 открыт Представлен BABEL‑codec — первый полностью сертифицированный декодер, позволяющий читать внутреннее состояние модели GPT‑2 small и записывать английский обратно. 🤖 При тестировании удалось восстановить 94,7 % поведения модели; результат сохраняется на всех уровнях слоёв и в разных текстовых режимах, а не только в одной точке. Все материалы опубликованы открыто: статья, полный лексикон, таблицы грамматики, веса кодера‑декодера, скрипты воспроизводства и демо‑интерфейс, где можно увидеть «мысли» модели по любой введённой фразе. https://github.com/wpferrell/babel-codec-gpt2
Источник ↗🤖 AI автоматизирует определение говорящих в звонках Новая система искусственного интеллекта способна автоматически распознавать всех участников разговора по транскрипции: оператора, клиента, IVR и любые многоголосые реплики. После диаризации каждый звонок оценивается, проверяется на соответствие требованиям и превращается в материал для обучения персонала без участия человека.
Источник ↗🚫 Meta убирает функцию Muse Image AI Meta объявила о прекращении работы функции Muse Image AI, объяснив решение тем, что она не обеспечивает достаточный уровень конфиденциальности пользователей. Функция была запущена во вторник и позволяла автоматически генерировать изображения, используя контент из публичных аккаунтов Instagram. На её работу сразу же поступила критика за возможные нарушения приватности. После отзыва компания заявила, что будет искать альтернативные решения, соответствующие требованиям защиты данных.
Источник ↗🚪 Руководитель отдела безопасности OpenAI уходит OpenAI объявила об уходе Йоханнеса Хайдека, возглавлявшего её отдел безопасности. Отход происходит в момент, когда компания работает над более тесной интеграцией исследовательских и безопасностных команд. 🔧 Это шаг, направленный на согласование разработки ИИ с требованиями безопасности.
Источник ↗🌐 ООН запускает инициативу по доверию к ИИ‑агентам Цифровое агентство ООН объявило о новой программе, направленной на повышение доверия к автономным ИИ‑системам, которые действуют от имени пользователей. В рамках инициативы будет создана фокус‑группа, разрабатывающая стандарты идентификации и надёжности ИИ‑агентов, чтобы предотвратить их использование для имитации людей и принятия несанкционированных решений. Группа также будет контролировать, чтобы в чувствительных операциях сохранялся реальный человеческий контроль. 🚀
Источник ↗