Лента новостей
🚩 Microsoft отключит AI‑функции в Teams по требованию пользователей После резкой критики Microsoft объявила, что в Teams можно будет отключать Copilot, Facilitator и Recap прямо во время встречи. Эта возможность будет доступна на Windows и других платформах, позволяя участникам контролировать использование ИИ в реальном времени. 🛠️
Источник ↗🤖 Новый открытый модельный набор Hy3 от Tencent Tencent выпустила модель Hy3 с общим числом параметров 295 млрд, из которых 21 млрд активны. Лицензия изменена на Apache 2.0, заменив прежнюю ограниченную community‑лицензию, которая не действовала в Южной Корее, Великобритании и странах ЕС. 📦 Полный набор доступен в коллекции Hugging Face: https://huggingface.co/collections/tencent/hy3. О версии сообщалось в твиттере пользователя elie (https://x.com/eliebakouch/status/2074011171661701466).
Источник ↗🎥 Локальная индексация видео для LLM Автор проекта создал конвейер, который один раз анализирует видеозаписи (скринкасты, баг‑репорты, демо, Loom) и сохраняет результаты полностью на локальном компьютере. При обработке извлекаются транскрипт, OCR‑текст, границы сцен и репрезентативные кадры, после чего формируется поисковый индекс с гибридным поиском — полнотекстовый + эмбеддинги — и привязкой к тайм‑стампам. Все данные хранятся локально, поэтому после индексации видео больше не отправляется в облако. LLM выступает лишь слоем рассуждения, а не обработки видео. Проект предоставляет MCP, CLI и REST API, позволяя менять локальные модели без изменения пайплайна. 🛠️ Открытый код доступен на GitHub: https://github.com/oxbshw/watch-skill. Автор приглашает к обратной связи разработчиков локальных AI‑стеков.
Источник ↗📹 AI‑агенты и забывающие видео Я работаю с AI‑агентами, которым уже удалось обеспечить память для текста: они могут искать в документации, индексировать репозитории, хранить прошлые диалоги и постепенно формировать долгосрочную память. С видеоматериалами ситуация иная – агент просто просматривает запись, отвечает на вопросы и после завершения сессии информация исчезает. При следующем запуске то же видео обрабатывается заново, хотя после извлечения транскриптов, OCR, визуальных наблюдений и меток времени эти данные могли бы сохраняться. Чтобы исправить «архитектурный пробел», я создал открытый проект watch‑skill (GitHub: https://github.com/oxbshw/watch-skill). При первом просмотре видео создаётся постоянный локальный индекс, а последующие запросы используют поиск по этому индексу вместо повторного анализа. Интересно узнать, считают ли другие разработчики отсутствие такой функции проблемой, или уже нашли свои решения. 🎯
Источник ↗🚀 Распределённое обучение стало реальностью Архитектура Psyche Network демонстрирует, что обучение нейросетей в распределённой сети возможно без узких мест передачи данных. Уже несколько моделей успешно обучены с помощью этого подхода; эффективность напрямую зависит от количества подключённых GPU. Подробности о запущенных задачах и результатах доступны по ссылке: https://psyche.network/runs 📊
Источник ↗⚔️ Конфликт Anthropic и Alibaba Anthropic обвинила Alibaba в создании десятков тысяч поддельных аккаунтов Claude для извлечения интеллектуальной собственности через атаки дистилляции. В ответ Alibaba попросила своих официальных (не подрядных) сотрудников прекратить использование Claude Code. По сообщениям в Reddit, Claude стал более осторожным к запросам, которые система считает «странными». Статья сообщает, что система Fable 5 усилена против дистилляционных атак, но теперь блокирует некоторых законных пользователей и отклоняет безвредные запросы, из‑за чего многие оказались в затруднительном положении.
Источник ↗🚀 Qualcomm представила GenieX для запуска LLM на Windows‑ноутбуках Платформа GenieX позволяет запускать крупные языковые модели непосредственно на ноутбуках с процессорами Qualcomm, закрывая отставание в поддержке SDK по сравнению с другими производителями чипов. Подробнее на https://aihub.qualcomm.com/geniex. Тесты показали скорость 20 токенов в секунду для модели Gemma 4 26B A4B с первой токен‑запросом за 0,5 с на GPU или NPU, а также 10 токенов в секунду для Qwen 3.6 27B MTP на GPU. С помощью llama.cpp любой Q4_0 GGUF‑модель работает на CPU, GPU и NPU. ⚡
Источник ↗🛠️ Прокативный контекстный куратор PRAANA вместо обычного компактора Автор провёл несколько месяцев, создавая проактивный механизм управления контекстным окном, в отличие от большинства кодирующих агентов, которые ждут заполнения окна и затем «сжимают» всё. PRAANA делит рабочую память на активный, мягкий и жёсткий уровни, оценивает единицы контекста по плотности информации и выбирает, что вернуть в активное окно, используя BM25 и семантическое сходство (Transformers.js в процессе). Ошибка оказалась в хеш‑базовом эмбеддере, который вводил шум в ранжирование воспоминаний; результаты приходили в неверном порядке, но выглядели правдоподобно, и проблему заметили только спустя три недели. Было заменено на Transformers.js с резервным поиском по ключевым словам, а теперь при отсутствии реального семантического эмбеддера используется только keyword‑поиск — никаких «фейковых» векторов. Для проверки эффективности был внедрён телеметрический дашборд: давление контекста, процент восстановления памяти, нагрузка навыков и их деградация, учёт токенов по секциям. Планируется A/B‑тестирование, а в дальнейшем система расширится четырьмя модулями (Adaptive Context, Cognitive Memory, Background Consolidation, Intelligent Router) и станет базой для создания доменных агентов. Репозиторий проекта: github.com/amitkumardubey/praana (MIT, TypeScript, Bun).
Источник ↗⚡️ Qwen 3.6 27B: сравнение BF16, FP8 и NVFP4 NVFP4 показал наибольшую скорость генерации токенов – до 174,7 t/s, что в 2,6 раз быстрее BF16 (≈61 t/s). FP8 оказался лидером по обработке подсказок: скорость предзаполнения (prefill) выросла на ≈20 % по сравнению с BF16 (≈4 748 t/s vs 4 359 t/s). При этом NVFP4 отстаивает FP8 в prefill на 10–15 % из‑за необходимости онлайн‑деквантования, но всё равно превышает BF16. Полные результаты: при контексте 0 k токенов NVFP4 генерирует 169,23 t/s, FP8 97,49 t/s; время до первого токена (TTFT) для NVFP4 ≈ 467 ms, для FP8 ≈ 430 ms, для BF16 ≈ 525 ms. Тест проводился на системе: материнская плата Asus ProArt Z890, процессор Intel 270K, 96 ГБ DDR5 (6000 MHz) и видеокарта RTX 6000 Pro Blackwell 96 GB (Max‑Q, ECC). ОС Ubuntu 26.04 LTS, Python 3.12.13, vLLM 0.24.0, CUDA 13.2. Параметры VLLM включали max_len = 262 144, gpu‑memory‑utilization = 0.88, kv‑cache‑dtype = fp8 и другие настройки, указанные в оригинальном отчёте.
Источник ↗🤖 Автоматизация контента через Cloud MCP Я полностью автоматизировал производство контента для соцсетей, подключив Cloud MCP. Управляю несколькими аккаунтами с умеренным объёмом, и создание постов было трудоёмким. Помогло подключение Claude MCP из инструмента управления соцсетями — сейчас многие компании внедряют его. После единожды подключения общаюсь с системой в чате, формирую план контента обычным разговором, а она генерирует посты с единым брендингом и «человеческим» голосом; всё можно одобрить в одном месте. Частая ошибка при автоматизации — использование шаблонных запросов, что приводит к однообразному контенту, который сразу бросается в глаза аудитории. Отсутствие фиксированного визуального стиля делает страницу похожей на работу нескольких людей. Работа через одну интегрированную систему решает обе проблемы автоматически 📈
Источник ↗