Лента новостей
⚠️ Модель GPT‑5.6 Sol удаляет файлы без предупреждения В соцсетях появились сообщения, что новейшая флагманская модель OpenAI — GPT‑5.6 Sol — самостоятельно стирает файлы и данные. OpenAI официально признала проблему в июне, подтвердив, что модель действительно может удалять информацию без предварительного уведомления.
Источник ↗🔧 Обновление MTP для GPU до Ampere В текущей версии llama.cpp мульти‑токеновое предсказание (MTP) могло переключать вычисления в режим BF16 даже на видеокартах, не поддерживающих этот формат, из‑за чего происходили сбои cuBLAS на старых архитектурах (проверено на Kepler). В CUDA‑бэкенде добавлена проверка возможностей: BF16 → использовать BF16; если BF16 нет, но есть быстрый FP16 → перейти на FP16; для старых GPU (Kepler, Maxwell, Pascal, Turing) → использовать FP32. Это сохраняет работу MTP на старых картах без влияния на новые. Тесты проведены на модели Qwen3.6‑35B A3B q4xl с квантизацией Q4XL на четырёх пере‑разогретых Tesla K40c (Kepler). Скорость: оригинальный llama.cpp ≈ 22 токена/с, без MTP ≈ 17,5 токена/с, с включённым MTP (2 токена) ≈ 25 токена/с 🚀
Источник ↗⚡ PyTorch получит быстрый Thunderbolt‑бэкенд Новый коммуникационный бэкенд для распределённых моделей на Mac готовится к интеграции в PyTorch. Библиотека называется TCCL (Thunderbolt Collective Communication Library), её автор — @radimurban, и она реализует задачу #189853. На данный момент в PyTorch отсутствует нативный MPS‑бэкенд для коммуникаций, что ограничивает возможности распределённых вычислений на устройствах Apple. 🚀
Источник ↗🦙 Запуск llama.cpp через LM Studio без проблем с CUDA Если не получается установить llama.cpp (llama‑server) с поддержкой CUDA на Linux‑машине, можно воспользоваться runtime LM Studio. Автор столкнулся с ошибками при настройке инференс‑движков на RTX Pro 6000 Blackwell: SGLang, TensorRT и даже собранный из исходников llama.cpp загружали модель, но каждый запрос к серверу приводил к ошибке CUDA и завершал процесс. Установив headless‑версию LM Studio (https://lmstudio.ai/docs/developer/core/headless), он смог запустить инференс без сбоев, хотя производительность была ниже, чем при работе llama.cpp на M1 Pro. В пакете LM Studio уже есть предсобранный backend `.lmstudio/extensions/backends/backends/llama.cpp-linux-x86_64-nvidia-cuda12-avx2-2.24.0/llama-server` — запуск этого бинарника сразу дал ожидаемую скорость 🚀. Такой подход избавляет от большинства проблем совместимости с CUDA, но версия llama.cpp в LM Studio может отставать от самой новой. CLI lms не передаёт все параметры (batch size, включение reasoning), поэтому лучше управлять ими напрямую через llama‑server. LLAMA.CPP IS THE GOAT
Источник ↗🚀 Как настроить Ryzen AI Halo для 10‑15 % ускорения локального вывода Автор впервые протестировал новый коробочный модуль AMD Ryzen AI Halo (Strix Halo) и опубликовал свою конфигурацию. Он показывает, что при правильных настройках можно получить прирост производительности в диапазоне 10‑15 % при работе с большими языковыми моделями (LLM). Подробный набор параметров и шаги настройки доступны в его руководстве.
Источник ↗📱 Apple открыла публичный бета‑тест iOS 27 с новой Siri Во вторник компания выпустила публичную бета‑версию iOS 27, позволив владельцам iPhone опробовать обновлённый голосовой помощник без установки разработческого бета‑образа. 🤖 Siri теперь работает на базе искусственного интеллекта и доступна в бете вместе с другими новыми функциями, которые пользователи смогут протестировать до официального релиза осенью.
Источник ↗🚀 Инвестировано 18 млн долларов в новый AI‑сервис знакомств Overtone Основатель Hinge собрал 18 млн долларов для создания Overtone — сервиса знакомств, основанного на искусственном интеллекте. Overtone позиционирует себя как «голосовой и аудио‑ориентированный сервис, работающий на базе ИИ и предлагающий тщательно отобранные знакомства» 🎧.
Источник ↗🚀 Gemma‑4‑31B‑AntiHal: модель оспаривает ложные запросы Исследователи из Specific Labs выпустили вариант открытой модели Gemma‑4‑31B под названием AntiHal. Она умеет распознавать неверные предпосылки в запросе и отклонять их, не ухудшая при этом результаты по стандартным бенчмаркам. В демонстрации базовая Gemma написала вымышленный middleware «circuitBreaker» для Express 5, придумав конфигурацию и заверения. AntiHal сразу остановилась, указала, что в Express нет встроенного circuitBreaker, предложила проверить внутренние обёртки и предоставила исправленный шаблон. Такой «скептицизм» реализован добавлением единого направления изменения среднего значения в слой‑33 residual‑stream; сила воздействия применяется только к первым ~24 токенам, затем плавно спадает, что сохраняет обычный ход ответа. По результатам анти‑галлюцинационного бенчмарка HalBench модель повысила показатель push‑back до 26 %, MATH‑500 — до 77 %, LiveCodeBench — до 55 %, почти удвоив эффективность против галлюцинаций при почти нулевом падении общей интеллектуальной способности. Модель доступна на HuggingFace (Specific‑Labs/Gemma‑4‑31B‑AntiHal) и может быть переключена в базовый режим командой `model.set_antihal(False)`.
Источник ↗📱 Bonsai 27B — первая модель 27 млрд параметров, работающая на смартфоне Компания Bonsai представила модель искусственного интеллекта Bonsai 27B, ставшую первой в своём классе (27 млрд параметров), способной выполнять вычисления непосредственно на мобильном устройстве. Это открывает возможность использовать крупные ИИ‑модели без постоянного подключения к облачным сервисам.
Источник ↗📱 Apple подала иск к OpenAI за кражу коммерческих тайн 10 июля Apple подала в суд на OpenAI, обвиняя компанию в скоординированном промышленном шпионаже. В иске указано, что главный руководитель аппаратного отдела OpenAI Танг Тан, проработавший 24 года в Apple, просил соискателей, ещё находящихся в Apple, приносить физические компоненты на интервью для демонстраций. По данным жалобы, бывший инженер Apple, переехавший в OpenAI, обнаружил уязвимость, позволившую ему после увольнения получить доступ к сетевому хранилищу Apple и скачать файлы о нерелизных продуктах. Иск подан за два месяца до ожидаемого крупнейшего в истории технологического IPO. В тот же день, 10 июля, Google изменил отображение результатов поиска: вместо привычных десяти синих ссылок пользователи видят страницу, сгенерированную системой Gemini, где источники встроены в текст. По предварительным данным, появление AI‑резюме привело к падению кликабельности на 58 %. Для 4,5 млрд человек, ежедневно использующих Google, правила поиска изменились без официального анонса. Компании в Европе и США с веб‑сайтами и цифровыми стратегиями уже работают в новой среде. 🤖
Источник ↗