Лента новостей

AIr/LocalLLaMA·14 июл. 2026 г., 19:56

🦙 Запуск llama.cpp через LM Studio без проблем с CUDA Если не получается установить llama.cpp (llama‑server) с поддержкой CUDA на Linux‑машине, можно воспользоваться runtime LM Studio. Автор столкнулся с ошибками при настройке инференс‑движков на RTX Pro 6000 Blackwell: SGLang, TensorRT и даже собранный из исходников llama.cpp загружали модель, но каждый запрос к серверу приводил к ошибке CUDA и завершал процесс. Установив headless‑версию LM Studio (https://lmstudio.ai/docs/developer/core/headless), он смог запустить инференс без сбоев, хотя производительность была ниже, чем при работе llama.cpp на M1 Pro. В пакете LM Studio уже есть предсобранный backend `.lmstudio/extensions/backends/backends/llama.cpp-linux-x86_64-nvidia-cuda12-avx2-2.24.0/llama-server` — запуск этого бинарника сразу дал ожидаемую скорость 🚀. Такой подход избавляет от большинства проблем совместимости с CUDA, но версия llama.cpp в LM Studio может отставать от самой новой. CLI lms не передаёт все параметры (batch size, включение reasoning), поэтому лучше управлять ими напрямую через llama‑server. LLAMA.CPP IS THE GOAT

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:55

🚀 Как настроить Ryzen AI Halo для 10‑15 % ускорения локального вывода Автор впервые протестировал новый коробочный модуль AMD Ryzen AI Halo (Strix Halo) и опубликовал свою конфигурацию. Он показывает, что при правильных настройках можно получить прирост производительности в диапазоне 10‑15 % при работе с большими языковыми моделями (LLM). Подробный набор параметров и шаги настройки доступны в его руководстве.

Источник ↗
AITechCrunch·14 июл. 2026 г., 19:43

📱 Apple открыла публичный бета‑тест iOS 27 с новой Siri Во вторник компания выпустила публичную бета‑версию iOS 27, позволив владельцам iPhone опробовать обновлённый голосовой помощник без установки разработческого бета‑образа. 🤖 Siri теперь работает на базе искусственного интеллекта и доступна в бете вместе с другими новыми функциями, которые пользователи смогут протестировать до официального релиза осенью.

Источник ↗
AITechCrunch·14 июл. 2026 г., 19:39

🚀 Инвестировано 18 млн долларов в новый AI‑сервис знакомств Overtone Основатель Hinge собрал 18 млн долларов для создания Overtone — сервиса знакомств, основанного на искусственном интеллекте. Overtone позиционирует себя как «голосовой и аудио‑ориентированный сервис, работающий на базе ИИ и предлагающий тщательно отобранные знакомства» 🎧.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:31

🚀 Gemma‑4‑31B‑AntiHal: модель оспаривает ложные запросы Исследователи из Specific Labs выпустили вариант открытой модели Gemma‑4‑31B под названием AntiHal. Она умеет распознавать неверные предпосылки в запросе и отклонять их, не ухудшая при этом результаты по стандартным бенчмаркам. В демонстрации базовая Gemma написала вымышленный middleware «circuitBreaker» для Express 5, придумав конфигурацию и заверения. AntiHal сразу остановилась, указала, что в Express нет встроенного circuitBreaker, предложила проверить внутренние обёртки и предоставила исправленный шаблон. Такой «скептицизм» реализован добавлением единого направления изменения среднего значения в слой‑33 residual‑stream; сила воздействия применяется только к первым ~24 токенам, затем плавно спадает, что сохраняет обычный ход ответа. По результатам анти‑галлюцинационного бенчмарка HalBench модель повысила показатель push‑back до 26 %, MATH‑500 — до 77 %, LiveCodeBench — до 55 %, почти удвоив эффективность против галлюцинаций при почти нулевом падении общей интеллектуальной способности. Модель доступна на HuggingFace (Specific‑Labs/Gemma‑4‑31B‑AntiHal) и может быть переключена в базовый режим командой `model.set_antihal(False)`.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:30

📱 Bonsai 27B — первая модель 27 млрд параметров, работающая на смартфоне Компания Bonsai представила модель искусственного интеллекта Bonsai 27B, ставшую первой в своём классе (27 млрд параметров), способной выполнять вычисления непосредственно на мобильном устройстве. Это открывает возможность использовать крупные ИИ‑модели без постоянного подключения к облачным сервисам.

Источник ↗
AIr/artificial·14 июл. 2026 г., 18:57

📱 Apple подала иск к OpenAI за кражу коммерческих тайн 10 июля Apple подала в суд на OpenAI, обвиняя компанию в скоординированном промышленном шпионаже. В иске указано, что главный руководитель аппаратного отдела OpenAI Танг Тан, проработавший 24 года в Apple, просил соискателей, ещё находящихся в Apple, приносить физические компоненты на интервью для демонстраций. По данным жалобы, бывший инженер Apple, переехавший в OpenAI, обнаружил уязвимость, позволившую ему после увольнения получить доступ к сетевому хранилищу Apple и скачать файлы о нерелизных продуктах. Иск подан за два месяца до ожидаемого крупнейшего в истории технологического IPO. В тот же день, 10 июля, Google изменил отображение результатов поиска: вместо привычных десяти синих ссылок пользователи видят страницу, сгенерированную системой Gemini, где источники встроены в текст. По предварительным данным, появление AI‑резюме привело к падению кликабельности на 58 %. Для 4,5 млрд человек, ежедневно использующих Google, правила поиска изменились без официального анонса. Компании в Европе и США с веб‑сайтами и цифровыми стратегиями уже работают в новой среде. 🤖

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 18:53

🚀 Bonsai 27B: 1‑битный LLM в браузере Команда PrismML представила модель Bonsai 27B, способную работать локально в вашем браузере с помощью собственных ядров WebGPU. 1‑битная квантизация уменьшила объём модели с 54 ГБ до 3,8 ГБ — снижение на 93 %, при этом сохраняется примерно 90 % её интеллектуальных возможностей. 🔗 Коллекция на Hugging Face: https://huggingface.co/collections/prism-ml/bonsai-27b 🔗 Демоверсия: https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 18:47

🚀 PrismML представила Bonsai 27B на основе Qwen3.6 PrismML выпустила модель Bonsai 27B, использующую тернарную квантизацию и построенную на Qwen3.6 27B. По производительности она почти соответствует fp16 и работает, занимая около 10 ГБ памяти. Запуск осуществляется через форк llama.cpp, на устройстве M4 Pro (48 ГБ RAM) с контекстом 32 K и поддержкой окна в 256 K и мультимодального ввода. В демонстрации модель быстро сгенерировала стилизованный интерактивный HTML‑отчёт о PrismML в среде OpenComputer. Сравнительные тесты показывают, что тернарный вариант Bonsai 27B значительно эффективнее 2‑3‑битных квантизаций Qwen3.6 27B и традиционной квантизации от Unsloth, приближаясь к точности оригинального fp16‑моделя. Ранний доступ к версии был получен двумя днями назад; модель уже доступна в HuggingFace. Подробнее в whitepaper, блоге PrismML и форках llama.cpp и MLX (ссылки в описании).

Источник ↗
AIr/artificial·14 июл. 2026 г., 18:42

📊 Надежный JSON‑вывод от LLM: 3‑месячный опыт За три месяца команда health‑приложения интегрировала генерацию структурированного JSON от 70‑млрд‑параметровой модели и добилась почти 100 % корректных ответов. Пробовали четыре подхода: простая инструкция «Return JSON» дала 40 % валидных результатов; добавление полной схемы в запрос – 75 %; включение JSON‑режима (Groq, OpenAI, Anthropic) – 92 %; комбинация JSON‑режима, проверка схемы и один‑разовый повтор с ошибкой в подсказке – 99,5 %. Оставшиеся проблемы – эмодзи в полях (ломают парсер), слишком длинные строки (превышение контекста) и редкий отказ модели выдавать JSON (≈0,5 %). В продакшене используется цепочка: запрос в JSON‑режиме → парсинг → логирование при ошибке → валидация Zod → один повтор с ошибкой в подсказке → статический fallback. Оказалось, что уровень модели влияет меньше, чем точность подсказки. Интересует, кто применяет более сложные методы, например Outlines или LMQL, для управления выводом 🔧

Источник ↗