Лента новостей
🛠️ Прокативный контекстный куратор PRAANA вместо обычного компактора Автор провёл несколько месяцев, создавая проактивный механизм управления контекстным окном, в отличие от большинства кодирующих агентов, которые ждут заполнения окна и затем «сжимают» всё. PRAANA делит рабочую память на активный, мягкий и жёсткий уровни, оценивает единицы контекста по плотности информации и выбирает, что вернуть в активное окно, используя BM25 и семантическое сходство (Transformers.js в процессе). Ошибка оказалась в хеш‑базовом эмбеддере, который вводил шум в ранжирование воспоминаний; результаты приходили в неверном порядке, но выглядели правдоподобно, и проблему заметили только спустя три недели. Было заменено на Transformers.js с резервным поиском по ключевым словам, а теперь при отсутствии реального семантического эмбеддера используется только keyword‑поиск — никаких «фейковых» векторов. Для проверки эффективности был внедрён телеметрический дашборд: давление контекста, процент восстановления памяти, нагрузка навыков и их деградация, учёт токенов по секциям. Планируется A/B‑тестирование, а в дальнейшем система расширится четырьмя модулями (Adaptive Context, Cognitive Memory, Background Consolidation, Intelligent Router) и станет базой для создания доменных агентов. Репозиторий проекта: github.com/amitkumardubey/praana (MIT, TypeScript, Bun).
Источник ↗⚡️ Qwen 3.6 27B: сравнение BF16, FP8 и NVFP4 NVFP4 показал наибольшую скорость генерации токенов – до 174,7 t/s, что в 2,6 раз быстрее BF16 (≈61 t/s). FP8 оказался лидером по обработке подсказок: скорость предзаполнения (prefill) выросла на ≈20 % по сравнению с BF16 (≈4 748 t/s vs 4 359 t/s). При этом NVFP4 отстаивает FP8 в prefill на 10–15 % из‑за необходимости онлайн‑деквантования, но всё равно превышает BF16. Полные результаты: при контексте 0 k токенов NVFP4 генерирует 169,23 t/s, FP8 97,49 t/s; время до первого токена (TTFT) для NVFP4 ≈ 467 ms, для FP8 ≈ 430 ms, для BF16 ≈ 525 ms. Тест проводился на системе: материнская плата Asus ProArt Z890, процессор Intel 270K, 96 ГБ DDR5 (6000 MHz) и видеокарта RTX 6000 Pro Blackwell 96 GB (Max‑Q, ECC). ОС Ubuntu 26.04 LTS, Python 3.12.13, vLLM 0.24.0, CUDA 13.2. Параметры VLLM включали max_len = 262 144, gpu‑memory‑utilization = 0.88, kv‑cache‑dtype = fp8 и другие настройки, указанные в оригинальном отчёте.
Источник ↗🤖 Автоматизация контента через Cloud MCP Я полностью автоматизировал производство контента для соцсетей, подключив Cloud MCP. Управляю несколькими аккаунтами с умеренным объёмом, и создание постов было трудоёмким. Помогло подключение Claude MCP из инструмента управления соцсетями — сейчас многие компании внедряют его. После единожды подключения общаюсь с системой в чате, формирую план контента обычным разговором, а она генерирует посты с единым брендингом и «человеческим» голосом; всё можно одобрить в одном месте. Частая ошибка при автоматизации — использование шаблонных запросов, что приводит к однообразному контенту, который сразу бросается в глаза аудитории. Отсутствие фиксированного визуального стиля делает страницу похожей на работу нескольких людей. Работа через одну интегрированную систему решает обе проблемы автоматически 📈
Источник ↗📦 Открыты веса модели longcat 2.0 Веса модели longcat 2.0 теперь доступны для скачивания под лицензией MIT. Размер набора — 1,6 ТБ, в нём примерно 48 млрд активных параметров. Это позволяет использовать модель без ограничений в коммерческих и исследовательских проектах.
Источник ↗📄 Новый научный доклад: «Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling» В статье представлена методика Multi-Resolution Flow Matching, позволяющая ускорить процесс диффузионного сэмплирования без дополнительного обучения моделей. Авторы предлагают поэтапный подход к выборке, который повышает эффективность генерации.
Источник ↗⚡️Контекст почти 100 К на 32 ГБ VRAM Исследователи достигли почти 100 000 токенов контекста, используя модель Qwen 3.6‑27 в 8‑битной (Q8) квантовании на видеокарте с 32 ГБ видеопамяти. Это позволяет обрабатывать более длинные тексты без увеличения требований к оборудованию.
Источник ↗🚗 Tesla расширила сервис роботакси в небольшом районе Майами Компания объявила о запуске своего роботакси‑сервиса в ограниченной части города Майами. Это первое расширение услуги в США после начального тестирования в Калифорнии. Пользователи в выбранном районе смогут заказывать поездки через приложение Tesla без участия водителя.
Источник ↗🎬 Midjourney просит студии Голливуда раскрыть детали использования ИИ Компания Midjourney обратилась к крупным кинокомпаниям с требованием публично сообщить, как именно они применяют искусственный интеллект в своих проектах. Запрос был озвучен в статье TechCrunch. Пока студии не дали официального ответа.
Источник ↗🔍 Возможный случай прямой подстановки запросов от Anthropic Сообщается, что в системе Anthropic обнаружены признаки буквальной подстановки запросов. Исследователи нашли доказательства, указывающие на то, что модель могла быть подвержена такому типу вмешательства 📌. Пока детали расследования не раскрыты, но инцидент подчёркивает необходимость дальнейшего анализа безопасности ИИ.
Источник ↗🧠 США и Китай контролируют обучение почти всех популярных ИИ‑моделей Американские и китайские компании отвечают за обучение почти всех самых используемых в мире моделей искусственного интеллекта. Это показывает, что лидирующие позиции в разработке ИИ сосредоточены в двух странах.
Источник ↗