Лента новостей
🚀 OpenAI представила семейство моделей GPT‑5.6 OpenAI объявила о запуске новой линейки моделей, в которой ключевым является GPT‑5.6. По заявлению компании, новые модели обещают улучшения в разных областях, в том числе в кибербезопасности 🔐
Источник ↗🤖 Lyzr привлекла $100 млн с помощью собственного ИИ‑агента Стартап Lyzr, разрабатывающий AI‑агенты для предприятий, использовал своего собственного агента для проведения раунда финансирования на $100 млн. 🚀 Таким образом компания продемонстрировала работоспособность своего продукта в реальном инвестиционном процессе.
Источник ↗🚀 OpenAI закрывает Atlas, но браузерные функции живут дальше OpenAI объявила о завершении работы AI‑браузера Atlas спустя менее года после его запуска. Некоторые возможности агентного браузинга будут перенесены в настольное приложение и в расширение для Google Chrome 📱. Развитие AI‑браузера продолжается в новых форматах.
Источник ↗🚀 Элон Маск поддержал Mythos/Fable и уверил Anthropic Элон Маск похвалил платформу Mythos/Fable и пообещал, что не будет «отключать» сервис Anthropic. 🤝 Он заявил, что компания способна обеспечить надёжный хостинг моделей Anthropic, несмотря на то, что от этого сотрудничества может зависеть около 40 млрд долларов дохода.
Источник ↗📄 OpenAI скрыла доказательства в деле о копирайте ChatGPT The New York Times заявила, что OpenAI скрыла важные материалы в процессе по делу о нарушении авторских прав, связанном с ChatGPT. 🔍 По словам новостных издателей, компания не предоставила инструменты и наборы данных, способные определить использование защищённой журналистикой информации в ответах модели. Это привело к усилению иска: истцы подали новое ходатайство о наложении санкций против OpenAI.
Источник ↗📢 Google будет показывать, какие объявления созданы ИИ Google анонсировала новую функцию, которая будет помечать рекламные материалы, созданные или отредактированные с помощью генеративных ИИ‑инструментов. 🛠️ При показе таких объявлений пользователи увидят специальный индикатор, указывающий на использование искусственного интеллекта рекламодателем. Об этом сообщает сама компания.
Источник ↗🛠️ Инструмент Boost сокращает терминальный шум для кодирующих агентов Разработчики JFrog создали лёгкий слой CLI Boost, который перехватывает вывод терминала и заменяет его короткими маркерами, например [Terminal Output Truncated: 450 lines of webpack build logs. Reference ID: log_9a3b. Status: Success]. При необходимости агент может «гидратировать» конкретный лог, вызвав подкоманду boost inspect log_9a3b, получив полный вывод локально. Внутренние тесты показали значительное снижение потребления токенов за сеанс без снижения успешности выполнения задач. Boost работает полностью локально, данные не покидают машину, а единственный сетевой запрос — лёгкий телеметрический ping для измерения экономии токенов. Бинарник доступен бесплатно на boost.jfrog.com, а релизы размещены в GitHub github.com/jfrog/boost; исходный код пока закрыт. Команда приглашает поделиться опытом по оптимизации контекста агентов без потери функциональности.
Источник ↗🔍 Исследование оптимизаций FlashAttention‑3/4 на RTX Автор проверил, работают ли улучшения FA‑3/4 на потребительских видеокартах RTX. На таких устройствах vLLM/SGLang автоматически используют FA‑2, а FA‑3 и FA‑4 официально поддерживаются только в дата‑центрах. Переписав ядра внимания, он добился того же времени — 206 µs на RTX 5090 (batch=1, heads=8, seq_len=4096, head_dim=64) — но новые оптимизации не принесли прироста. FA‑3 опирается на ускоренные тензорные инструкции WGMMA, которых нет в RTX, а TMA (tensor memory accelerator) доступен только в SM 120 (RTX 5XXX) и не является узким местом, поэтому итоговое время почти не меняется (213 µs vs 206 µs). Специализация warp помогает лишь в планировании, без асинхронных тензорных инструкций эффект отрицательный. В FA‑4 симулируют exp через FMA, что полезно для B200, где узким местом становится SFU, но RTX 5090 ограничен тензорными ядрами, так что ускорения нет; даже замена expf на exp2f не меняет результат. Автор пробовал более глубокие конвейеры, регистровый ping‑pong и другие трюки, но без успеха. Вывод: для потребительских RTX‑GPU потолок — FA‑2; дальнейшее ускорение потребует компромисса в точности и использования более низкой точности тензорных ядер. Подробнее в статье https://riftstack.ai/research/learning-flashattention-the-hard-way-part-2 и репозитории github.com/cloudrift-ai/emmy.
Источник ↗⚡️Puzzle‑75B на трёх RTX 3090: 132 токена/с Модель 75 B (total) / 9 B (active) MoE идеально подходит для систем с несколькими видеокартами по 24 GB, однако почти никто её не использует. Запуск производится через Nemotron‑3‑Puzzle‑75B‑A9B, NVFP4, vLLM 0.22.1 (новый fallback Marlin работает в FP4 на Ampere) с пайплайн‑параллелизмом на трёх RTX 3090, каждая ограничена 200 Вт; четвёртая карта обслуживает отдельный модуль речи, поддерживает 3 сеанса × 256 K контекста, fp8 KV, гибридный Mamba удерживает кэш небольшим. 🔧 Производительность: 132 токена/с декодирования на три потока (≈65 токен/с в одиночном режиме) и 1 949 токенов/с предзаполнения, суммарное энергопотребление около 500 Вт. Эта конфигурация заменила Nemotron Super 120B MoE GGUF, требовавший четыре RTX 3090, обеспечивая лучшее следование инструкциям и примерно вдвое большую скорость на ватт, освободив одну видеокарту. Модели 30 B‑A3B оставляют большую часть видеопамяти неиспользуемой, а 120 B+ переполняют RAM и работают медленно или требуют сильной квантизации. Конфигурация 70‑80 B (total) / ≈10 B (active) полностью заполняет 72 GB квантизированной VRAM, сочетая качество плотного класса с скоростью A3B‑класса. Сейчас Puzzle — единственная современная опция в этом диапазоне.
Источник ↗📢 Новый аудио‑модель MOSS‑Transcribe‑Diarize 0.9B Представлена модель MOSS‑Transcribe‑Diarize 0.9B — сквозная система распознавания и диаризации длительных многоговорящих записей. За один проход она превращает аудио или видео в компактный транскрипт с тайм‑стампами и анонимными метками говорящих ([S01], [S02] и т.д.). Поддерживает пользовательские инструкции, «горячие» слова и аннотации акустических событий, что упрощает последующую обработку. Текстовый бэкбоун — Qwen3‑0.6B‑style causal decoder, аудио‑энкодер — Whisper‑Medium, фронтенд — WhisperFeatureExtractor (16 kHz, 80 мел‑бин, куски по 30 с). Связка аудио‑текст реализована через 4‑кратное временное объединение + MLP‑адаптер. Выходной формат: [start][Sxx]текст[end] с метками говорящих. Модель предназначена для встреч, звонков, подкастов, интервью, лекций и других длительных записей. 🎙️ Скачать GGUF‑версию можно здесь: https://huggingface.co/mudler/moss-transcribe.cpp-gguf
Источник ↗