Лента новостей
📄 OpenAI скрыла доказательства в деле о копирайте ChatGPT The New York Times заявила, что OpenAI скрыла важные материалы в процессе по делу о нарушении авторских прав, связанном с ChatGPT. 🔍 По словам новостных издателей, компания не предоставила инструменты и наборы данных, способные определить использование защищённой журналистикой информации в ответах модели. Это привело к усилению иска: истцы подали новое ходатайство о наложении санкций против OpenAI.
Источник ↗📢 Google будет показывать, какие объявления созданы ИИ Google анонсировала новую функцию, которая будет помечать рекламные материалы, созданные или отредактированные с помощью генеративных ИИ‑инструментов. 🛠️ При показе таких объявлений пользователи увидят специальный индикатор, указывающий на использование искусственного интеллекта рекламодателем. Об этом сообщает сама компания.
Источник ↗🛠️ Инструмент Boost сокращает терминальный шум для кодирующих агентов Разработчики JFrog создали лёгкий слой CLI Boost, который перехватывает вывод терминала и заменяет его короткими маркерами, например [Terminal Output Truncated: 450 lines of webpack build logs. Reference ID: log_9a3b. Status: Success]. При необходимости агент может «гидратировать» конкретный лог, вызвав подкоманду boost inspect log_9a3b, получив полный вывод локально. Внутренние тесты показали значительное снижение потребления токенов за сеанс без снижения успешности выполнения задач. Boost работает полностью локально, данные не покидают машину, а единственный сетевой запрос — лёгкий телеметрический ping для измерения экономии токенов. Бинарник доступен бесплатно на boost.jfrog.com, а релизы размещены в GitHub github.com/jfrog/boost; исходный код пока закрыт. Команда приглашает поделиться опытом по оптимизации контекста агентов без потери функциональности.
Источник ↗🔍 Исследование оптимизаций FlashAttention‑3/4 на RTX Автор проверил, работают ли улучшения FA‑3/4 на потребительских видеокартах RTX. На таких устройствах vLLM/SGLang автоматически используют FA‑2, а FA‑3 и FA‑4 официально поддерживаются только в дата‑центрах. Переписав ядра внимания, он добился того же времени — 206 µs на RTX 5090 (batch=1, heads=8, seq_len=4096, head_dim=64) — но новые оптимизации не принесли прироста. FA‑3 опирается на ускоренные тензорные инструкции WGMMA, которых нет в RTX, а TMA (tensor memory accelerator) доступен только в SM 120 (RTX 5XXX) и не является узким местом, поэтому итоговое время почти не меняется (213 µs vs 206 µs). Специализация warp помогает лишь в планировании, без асинхронных тензорных инструкций эффект отрицательный. В FA‑4 симулируют exp через FMA, что полезно для B200, где узким местом становится SFU, но RTX 5090 ограничен тензорными ядрами, так что ускорения нет; даже замена expf на exp2f не меняет результат. Автор пробовал более глубокие конвейеры, регистровый ping‑pong и другие трюки, но без успеха. Вывод: для потребительских RTX‑GPU потолок — FA‑2; дальнейшее ускорение потребует компромисса в точности и использования более низкой точности тензорных ядер. Подробнее в статье https://riftstack.ai/research/learning-flashattention-the-hard-way-part-2 и репозитории github.com/cloudrift-ai/emmy.
Источник ↗⚡️Puzzle‑75B на трёх RTX 3090: 132 токена/с Модель 75 B (total) / 9 B (active) MoE идеально подходит для систем с несколькими видеокартами по 24 GB, однако почти никто её не использует. Запуск производится через Nemotron‑3‑Puzzle‑75B‑A9B, NVFP4, vLLM 0.22.1 (новый fallback Marlin работает в FP4 на Ampere) с пайплайн‑параллелизмом на трёх RTX 3090, каждая ограничена 200 Вт; четвёртая карта обслуживает отдельный модуль речи, поддерживает 3 сеанса × 256 K контекста, fp8 KV, гибридный Mamba удерживает кэш небольшим. 🔧 Производительность: 132 токена/с декодирования на три потока (≈65 токен/с в одиночном режиме) и 1 949 токенов/с предзаполнения, суммарное энергопотребление около 500 Вт. Эта конфигурация заменила Nemotron Super 120B MoE GGUF, требовавший четыре RTX 3090, обеспечивая лучшее следование инструкциям и примерно вдвое большую скорость на ватт, освободив одну видеокарту. Модели 30 B‑A3B оставляют большую часть видеопамяти неиспользуемой, а 120 B+ переполняют RAM и работают медленно или требуют сильной квантизации. Конфигурация 70‑80 B (total) / ≈10 B (active) полностью заполняет 72 GB квантизированной VRAM, сочетая качество плотного класса с скоростью A3B‑класса. Сейчас Puzzle — единственная современная опция в этом диапазоне.
Источник ↗📢 Новый аудио‑модель MOSS‑Transcribe‑Diarize 0.9B Представлена модель MOSS‑Transcribe‑Diarize 0.9B — сквозная система распознавания и диаризации длительных многоговорящих записей. За один проход она превращает аудио или видео в компактный транскрипт с тайм‑стампами и анонимными метками говорящих ([S01], [S02] и т.д.). Поддерживает пользовательские инструкции, «горячие» слова и аннотации акустических событий, что упрощает последующую обработку. Текстовый бэкбоун — Qwen3‑0.6B‑style causal decoder, аудио‑энкодер — Whisper‑Medium, фронтенд — WhisperFeatureExtractor (16 kHz, 80 мел‑бин, куски по 30 с). Связка аудио‑текст реализована через 4‑кратное временное объединение + MLP‑адаптер. Выходной формат: [start][Sxx]текст[end] с метками говорящих. Модель предназначена для встреч, звонков, подкастов, интервью, лекций и других длительных записей. 🎙️ Скачать GGUF‑версию можно здесь: https://huggingface.co/mudler/moss-transcribe.cpp-gguf
Источник ↗🎮 GLM 5.2 создал 3D‑игру за одну итерацию Я разработал простую 3D‑игру в стиле Geometry Wars, используя кодирующего агента Jarvis Code и модель GLM 5.2. Играть можно по ссылке: https://jarvis-llm-codec.github.io/jarvis-code/geometry-wars-3d.html Большая часть игры была сгенерирована уже в первой итерации, после чего потребовалось лишь около четырёх небольших доработок 🛠️. Буду рад вашим отзывам о геймплее, качестве кода и способности GLM 5.2 к программированию.
Источник ↗🩺 Новый медицинский ИИ‑модель Исследователи представили Reasoning-Medical0.1-27B — модель, доработанную на основе Qwen3.5-27B для медицинских задач. Разработчики заявляют, что она превосходит текущую модель MedGemma. 🔬 Проект ориентирован на развитие и демократизацию искусственного интеллекта через открытый код и открытую науку.
Источник ↗🚀 Маленькие модели ускоряют развитие Большинство новостей об ИИ в этом году фиксируют только текущие баллы: Claude Opus — 88.6, GPT‑5.5 — 88.7. Эти цифры показывают лишь прошлое, а не динамику. Более показательным является скорость изменения (RoC). В декабре 2024 лучшая открытая модель для кодинга, работающая на обычном потребительском GPU, набрала 20.6 % в тесте SWE‑bench Verified. Сейчас её результат — 77.2 %. Разница с закрытыми лидерами сократилась до 18.3 пунктов, и она уменьшается быстрее, чем у закрытых моделей: 2.73 пункта в месяц против 1.83 у закрытого фронтира. Подробнее: https://preview.redd.it/4emhf6wml6ch1.jpg?width=1143&format=pjpg&auto=webp&s=3beee52b7a50062fd2cc325d154cc93b05a428ae
Источник ↗🚀 Gradium привлек $100 млн в посевном раунде Французский стартап Gradium, специализирующийся на ИИ‑голосе, объявил о закрытии посевного раунда на 100 млн долларов. Инвестором в раунде стала Nvidia, а компания позиционирует себя как конкурент ElevenLabs 🎙️. Полученные средства будут направлены на дальнейшее развитие технологий синтеза речи.
Источник ↗