Лента новостей

AIr/LocalLLaMA·14 июл. 2026 г., 15:28

🚀 Администрация Трампа и отраслевые группы обсудили упрощение выпуска открытых ИИ‑моделей в США Встреча представителей администрации США при Дональде Трампе и представителей технологических компаний прошла с целью обсудить ускорение публикации открытых моделей искусственного интеллекта, сопоставимых по возможностям с ведущими китайскими открытыми моделями, либо менее мощных. Участники отметили необходимость упростить процесс выпуска таких моделей, чтобы обеспечить более быстрый доступ к технологиям и поддержать конкурентоспособность США в сфере ИИ.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 15:24

🚀 Первая оценка VBR‑кеша от Spiritbuun Автор тестировал несколько форков llama.cpp и нашёл оптимальное сочетание: форк Spiritbuun + CUDA + квантование Apex I‑Compact от mudler для модели Qwen3.6‑35B‑A3B. После выхода turbo8 он переключил key‑cache на эту версию, получив ту же скорость, но в двойной точности. Новая функция VBR позволяет задать минимальный уровень квантования (например, turbo3_tcq ≈ 3.25 бита/значение) и автоматически понижать его (turbo8 → turbo4 → 3_tcq → 2_tcq → 1_tcq), чтобы не превышать доступный объём видеопамяти. Команда запуска выглядит так: `llama-server -m Qwen3.6-35B-A3B-APEX-MTP-I-Compact.gguf --host 0.0.0.0 --port 8000 --no-mmap --mlock -ctk turbo8 -ctv vbr --vbr-floor turbo3_tcq --flash-attn on -ngl 99`. Тесты (5 запусков, bench.sh от club‑3090) показали: при turbo8+vbr TPS ≈ 50.85, TTFT ≈ 93 мс, VRAM ≈ 10.2 ГБ; при фиксированном turbo8+turbo4 TPS ≈ 52.83, TTFT ≈ 178 мс, VRAM ≈ 11 ГБ. VBR медленнее лишь на ~4 %, но время первой токен‑выдачи почти вдвое быстрее, а потребление памяти ниже. Автоматически подбирается контекст до 216 k токенов. Автор отметил плавную работу деградатора, отсутствие заметных падений TPS и стабильность форка, несмотря на найденный баг в асимметричных ядрах f16 t8, который был откатан. Fork доступен на GitHub: https://github.com/spiritbuun/llama.cpp.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 15:23

🤖 Новый метод асинхронного обучения для агентных LLM Традиционные RL‑конвейеры для больших языковых моделей работают синхронно и пакетно, что замедляет решение задач с длительным горизонтом. Асинхронный RL обновляет модель по мере поступления роллаутов, но большинство систем сосредоточены лишь на пропускной способности, оставляя вопросы стабильности обучения и эффективности задачи. В статье «Single‑Rollout Asynchronous Optimization (SAO)» предложен подход, заменяющий групповую выборку в рамках GRPO на одиночную выборку роллаута (по одному роллаута на запрос). Добавлены практические схемы обучения value‑модели и строгая двойная токен‑уровневая обрезка, что повышает стабильность оптимизации. SAO стабильно обучается тысячу шагов и превосходит GRPO и его варианты на бенчмарках агентного кодирования и рассуждения — SWE‑Bench Verified, BeyondAIME, IMOAnswerBench. Метод также показал высокую эффективность в симулированных онлайн‑обучениях с меняющейся средой. Технология уже внедрена в агентный RL‑конвейер для обучения открытой модели GLM‑5.2 (750B‑A40B). 📈

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 15:21

🚀 NVIDIA представила Nemotron‑3‑Embed 8B Новая модель Nemotron‑3‑Embed‑8B‑BF16 от NVIDIA предназначена для создания текстовых эмбеддингов и оптимизирована под задачи поиска и семантического сходства. Она протестирована на 34 языках: английском, арабском, ассамском, бенгальском, болгарском, китайском, датском, нидерландском, финском, французском, немецком, хинди, хинглиш, индонезийском, итальянском, японском, корейском, малайском, маратхи, непальском, норвежском, персидском, португальском, румынском, русском, испанском, суахили, шведском, тамильском, телугу, тайском, украинском, урду, вьетнамском. Модель преобразует многоязычный текст в плотные векторные представления, что позволяет использовать её в системах Retrieval‑Augmented Generation, семантического поиска и других RAG‑процессах. По состоянию на июль 2026 года Nemotron‑3‑Embed‑8B‑BF16 занимает лидирующие позиции в мультилингвальном рейтинге RTEB и доступна для коммерческого применения.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 15:14

🛡️ Хассабис призывает к глобальному надзору за ИИ под руководством США Генеральный директор Google DeepMind Демис Хассабис предложил создать международный орган, возглавляемый США, который будет контролировать развитие передовых систем искусственного интеллекта. Он изложил свою позицию в статье «A Framework for Frontier AI and the Dawning of a New Age» на Substack 📄 от 14 июля 2026 г. (https://demishassabis.substack.com/p/a-framework-for-frontier-ai-and-the-dawning-of-a-new-age) и разместил короткое сообщение в X с той же ссылкой (https://x.com/demishassabis/status/2076957440109625718). Об этом сообщает Axios (https://www.axios.com/2026/07/14/demis-hassabis-ai-regulation-google-deepmind?mrfcid=202607146a4b28424486741cce8ae26d). Хассабис подчёркивает необходимость согласованных правил и мониторинга для снижения рисков, связанных с передовыми ИИ‑технологиями.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 15:13

🔧 Тестирование вывода LLM с Pydantic AI В статье на coles.codes отмечается, что даже при температуре 0 один и тот же запрос к языковой модели может дать разные ответы. 🧪 Это происходит из‑за того, что стек вывода не является батч‑инвариантным, а при работе с облачным API размер батча нельзя контролировать. Автор предлагает решать проблему, повторяя запросы и вычисляя процент успешных результатов вместо единичного «хрупкого» ответа, а также использовать структурированные выводы Pydantic AI и откалиброванного судью для оценки.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 15:10

🚀 Тест локального агента на Mistral Small: уязвим к запросам‑инъекциям Мы подключили к локальному Mistral Small простого поддерживающего бота, написанного на Flask, который получает сообщение клиента, ищет его заказы и решает, выдавать ли возврат. Всё работает полностью локально через Ollama, без внешних API. При «наивном» запросе без защит модель одобрила возврат 4000 €, хотя реальная сумма заказа составляла 1299 €. Бот выдал полную сумму, указанную в команде. После замены подсказки на защищённую (явные правила, разделение данных и инструкций, закрытая схема) тот же Mistral Small отказал в возврате, сославшись на политику. Разница составила всего пять строк текста. Формат JSON в провайдере Ollama устранил около 90 % проблем с «сломанным JSON». Более крупная модель Sonnet смогла противостоять инъекции, но нарушила бизнес‑правило, которое не было задано в наивной подсказке. Лучший размер модели не заменяет правильный запрос. Вопрос к сообществу: какие инструменты вы используете для тестирования локальных моделей, есть ли альтернатива promptfoo?

Источник ↗
AITechCrunch·14 июл. 2026 г., 14:41

💡 Reflection AI подписала миллиардный контракт с Nebius Компания Reflection AI заключила сделку на 1 млрд долларов, получив доступ к вычислительным ресурсам Nebius 🖥️. Reflection AI основана в 2024 году и разрабатывает открытые технологии искусственного интеллекта.

Источник ↗
AITechCrunch·14 июл. 2026 г., 14:25

🚀 Реальная гонка ИИ смещается от передовых моделей Генеральный директор Hugging Face Клем Делангю сообщил, что предприятия всё чаще отдают предпочтение открытым моделям из‑за их низкой стоимости, доступности и возможности сохранять контроль над данными. Открытые модели позволяют компаниям экономить на лицензиях и адаптировать решения под свои задачи. Вопрос остаётся открытым: будут ли передовые модели по‑прежнему важны, если большинство производственных ИИ‑систем будет работать именно на открытых решениях?

Источник ↗
AITechCrunch·14 июл. 2026 г., 14:07

🎧 Spotify запускает AI‑ассистент для Premium Spotify расширяет свои возможности в сфере искусственного интеллекта, представив новый разговорный сервис, напоминающий ChatGPT. 🎙️ Функция доступна только подписчикам Premium и позволяет в чате искать музыку, подкасты, аудиокниги и другие аудио‑материалы. Сервис работает непосредственно в приложении, отвечая на запросы пользователей в реальном времени.

Источник ↗