Лента новостей
🚀 Карусель китайских LLM продолжается Китайские разработчики продолжают выпускать новые большие языковые модели без перерыва. На следующей неделе запланирован релиз модели MiniMax 🤖. MiniMax будет доступен уже в начале следующей недели.
Источник ↗🚀 Kimi K3 достиг уровня Frontier Kimi K3 от Moonshot попал в категорию frontier как open‑weight модель. По рейтингу Artificial Analysis он занял 4‑е место из 580 моделей, уступая лишь Claude Opus 5, Fable 5 и GPT‑5.6 Sol. Moonshot опубликовал не только веса, но и 47‑страничный технический отчёт и код. В нём выделены три ключевых решения. 🔧 Kimi Delta Attention заменяет KV‑кеш в 69 из 93 слоёв одной матрицей 128×128 на каждый голова, что уменьшает потребление памяти для контекста в 1 млн токенов с 104,6 ГиБ до 27,2 ГиБ. Quantile Balancing равномерно распределяет нагрузку между 896 экспертами в каждом слое, а K3 вычисляет bias напрямую из маржин роутера одной партии, обходя ограничение DeepSeek‑V3. Для обучения с подкреплением используется среда AgentENV на базе микровиртуальной машины Firecracker, создавшая 51 млн «песочниц» с контрольными точками за 133 мс и возобновлением за 49 мс, позволяя модели «пауза» без потерь. Полный разбор доступен: https://codepointer.substack.com/p/how-kimi-k3-engineered-its-way-to
Источник ↗🔐 Новый рейтинг безопасности ИИ‑моделей Создана первая в мире таблица лидеров, оценивающая устойчивость передовых ИИ‑моделей к взломам. В отличие от привычных рейтингов возможностей, здесь измеряется именно безопасность, что становится критически важным при выборе моделей для реального применения. Автоматический набор тестов проверяет модели на 1500 сгенерированных попыток «jailbreak» и фиксирует количество универсальных взломов — запросов, получающих детальные ответы на более чем 75 % явно вредоносных вопросов в выбранных областях (например, кибербезопасность). По результатам технического отчёта обнаружен значительный разрыв между самыми и наименее надёжными моделями. Разработчики объявили версию v1.0 и приглашают сообщество к обсуждению дальнейших шагов: добавить открытые модели и сравнить их с проприетарными, расширить набор областей (например, захват агентов, вредоносные манипуляции), повысить реалистичность сценариев и усилить атаки, включая адаптивные оптимизационные методы. Исследователи в области адверсарной устойчивости могут предложить свои наборы данных, критерии оценки или другие артефакты для улучшения бенчмарка.
Источник ↗🚀 Универсальный ML‑инференс на всех устройствах Команда PostSlate, разработчик видеоредактора, решила запускать модели машинного обучения прямо на устройстве, не привязываясь к типу видеокарты пользователя – будь то NVIDIA, AMD, Intel или Apple Silicon. ⚡ Выбрав Vulkan‑бэкенд ncnn, они добились ускорения: на RTX 4070 (fp16) модель ArcFace R50 сократила время с 30 мс (ONNX CPU) до 3 мс, а SCRFD для детекции лица – с 25 мс до 2,5 мс. Размер модели ArcFace уменьшился с 174 МБ (ONNX fp32) до 87 МБ (ncnn fp16). Важным преимуществом стало то, что драйверы Vulkan уже присутствуют на всех поставляемых машинах, поэтому пользователям не требуется устанавливать отдельные runtime‑пакеты или зависеть от конкретного производителя. Подробнее о тестах и результатах: https://getpostslate.com/blog/faster-local-inference
Источник ↗📚 Более половины научных статей уже используют ИИ В исследовании, опубликованном в PNAS, проанализировано 7,3 млн публикаций. По результатам, к 2025 году более 50 % статей показывают влияние больших языковых моделей (LLM). Это самое масштабное эмпирическое исследование проникновения ИИ в академическую среду, подтверждающее, насколько глубоко LLM изменили научное письмо. Отмечено неравномерное внедрение: модели чаще используют учреждения с низким престижем и неанглоязычные институты, что создаёт новую политику‑проблему. Источник: pnas.org/doi/10.1073/pnas.2605754123
Источник ↗🔄 Новый подход к обучению RL Исследователи представили Policy Improvement Reinforcement Learning (PIRL) и её практическую реализацию — Policy Improvement Policy Optimization (PIPO). Это plug‑and‑play‑структура, позволяющая проверять каждый шаг обучения и усиливать или корректировать его в зависимости от реального изменения качества политики. Текущие методы пост‑тренинга (PPO, GRPO, GSPO, DAPO, on‑policy distillation, self‑distillation) работают в «open‑loop»: берут батч из текущей политики, вычисляют вознаграждения или преимущества, обновляют политику и переходят к следующему батчу, не проверяя, действительно ли обновление улучшило поведение. PIRL вводит обратную связь о приросте производительности между соседними политиками. PIPO реализует это в два этапа: 1) Exploration — базовый алгоритм (например, PPO) делает обычный шаг обновления; 2) Retrospective verification — на следующей итерации сравнивается новая политика с историческим «якорем» и, если результат лучше, обновление усиливается, а если хуже — корректируется. Эксперименты показали стабильный прирост точности в задачах математического рассуждения, генерации кода, использования инструментов и самодистилляции, а также более надёжную тренировку при разных случайных инициализациях. При сопоставимом или слегка увеличенном времени обучения PIPO достигает более высоких результатов. 📄 Статья: https://arxiv.org/abs/… 💻 Код: https://github.com/JacckMa/pipo_verl
Источник ↗🚀 Открыты веса DeepSeek‑V4‑Flash‑0731 Модель DeepSeek‑V4‑Flash‑0731 теперь доступна с открытыми весами. Репозиторий размещён на Hugging Face по адресу deepseek‑ai/DeepSeek‑V4‑Flash‑0731. Эти файлы можно скачать и использовать в своих проектах.
Источник ↗🚀 Порт TurboFieldfare на Qwen 3.6 35B TurboFieldfare — движок для macOS, который запускал Gemma 4 26B на ~2 ГБ ОЗУ, выгружая MoE‑эксперты с SSD. Был добавлен новый режим поддержки модели Qwen 3.6 35B‑A3B. Потребление памяти у Qwen снижается до ~1,4 ГБ, тогда как Gemma требовала ~2,1 ГБ. Эксперты Qwen в два раза легче, а 30 из 40 слоёв используют линейное внимание, что резко уменьшает KV‑кеш. Скорость работы на процессоре M5 составляет 19–23 токена/сек при разных длинах запросов; Gemma показывала 31–35 токенов/сек на том же устройстве. Qwen работает медленнее из‑за 18 ГБ экспертов, которые не помещаются в кэш ОС, поэтому частые обращения к SSD. Ограничение рабочей памяти до 8 ГБ не изменило результат: 22,9 токена/сек и идентичный вывод, поскольку данные уже стримятся с диска. Открыт pull‑request в оригинальном репозитории (drumih/turbo-fieldfare#29). Сборка доступна в ветке NeelM0906/turbo-fieldfare@qwen36-support. Тесты проводились в режиме только текста, контекст 4 К, требуется ~20 ГБ дискового пространства; тест с 8 ГБ памяти был симуляцией нагрузки, а не реальным 8‑ГБ Mac. 🌐
Источник ↗🚀 Европа готовится регулировать передовые ИИ С 2 августа Брюссель получит широкие полномочия, позволяющие контролировать развитие и применение передовых технологий искусственного интеллекта на глобальном уровне.
Источник ↗🚀 DeepSeek V4‑Flash набрал 50 баллов Новая модель DeepSeek V4‑Flash получила 50 очков в рейтинге ArtificialAnalysis Index. Это на один балл меньше, чем у моделей GLM‑5.2 и GPT‑5.6 Luna.
Источник ↗