Лента новостей
🤖 LLM не заменят реальных пользователей В рамках массовой попытки компаний заменить человеческую обратную связь «синтетическими пользователями», исследователи проверили, насколько крупные языковые модели (LLM) способны предсказывать реальные предпочтения. Тестирование охватило 28 реальных исследований и 78 задач выбора, в которых участвовали тысячи людей. LLM совпадали с большинством человеческих ответов лишь в 53 % случаев – почти как бросок монеты при бинарных выборах. Добавление детализированных персонажей и цепочек рассуждений не улучшило результат: сходство с человеческими обоснованиями даже ухудшилось, поскольку «рассуждения» модели делали ответы более однородными и не отражали реальный опыт людей. Исследование показывает, что текущие LLM лучше имитируют то, что им нравится в выводах, чем способны предсказывать человеческие предпочтения. 📊
Источник ↗🚧 Китай планирует ограничить доступ к ИИ за рубежом Китай рассматривает введение ограничений на предоставление зарубежным пользователям доступа к отечественным моделям искусственного интеллекта. В то же время компания DeepSeek объявила о разработке собственного чипа для инференса ИИ 🤖, что позволит снизить зависимость от графических процессоров Nvidia. Новый чип направлен на создание полностью отечественного решения для ускорения работы нейросетей.
Источник ↗🎙️ Как ИИ может вести подкаст без скучных монологов Автор экспериментировал с генерацией подкаста из обсуждений Hacker News. Оказалось, что написание сценария занимает лишь около 20 % работы, а остальное — борьба с тем, как модель обычно формирует текст. Самым эффективным оказалось два приёма: 1) задать ограничение, а не инструкцию — дать двум «ведущим» разную информацию (один читает статью, другой — комментарии), из‑за чего они начинают спорить, а не просто соглашаются; 2) предварительно отобрать материал, используя простой «продюсер», который выбирает несколько комментариев для обсуждения, после чего основной ИИ пишет эпизод. При тестах возникали комичные ошибки: «API» прозвучало как «appy», число 1 204 озвучивалось как «one thousand two hundred and four», а пометка «[sigh]» читалась буквально. Подробный разбор и аудио‑примеры доступны по ссылке: https://hnlisten.app/blog/i-told-the-ai-to-sigh. Автор интересуется, какие приёмы используют другие создатели AI‑подкастов, чтобы звук был менее похож на эссе и включал настоящие разногласия.
Источник ↗📊 AI Pulse Dashboard — панель в одном HTML‑файле Создан одностраничный дашборд без серверной части, который собирает более 600 моделей ИИ от более 170 компаний. Автор отметил, что быстрый рост количества новых моделей усложняет слежение за ценами и бенчмарками, поэтому разработал инструмент, обновляющий данные через Python‑конвейер одним кликом; новые релизы попадают в базу в течение суток. 🛠️ Подробнее на странице проекта: https://github.com/T-a-c-h-y-o-n/aipulse/
Источник ↗🧠 Новый способ «видеть» скрытые слова ИИ Anthropic опубликовала сегодня исследование J‑space, в котором показано, что у больших языковых моделей существует небольшое набор внутренних «тихих слов» — около нескольких десятков концепций одновременно. Инструмент Subtext запускает модель Qwen3.5‑4B в bf16 на одной видеокарте 12 ГБ и анализирует 9 слоёв для каждого токена как при чтении входного сообщения, так и при генерации ответа. Процесс идёт со скоростью полной генерации, поскольку «линза» представляет собой лишь матричное умножение и развертывание на каждом слое. Пример: при вводе «is this correct? 12 + 5 = 1» неверный вывод подсвечивается в сети ещё до того, как модель сформирует ответ. На этом этапе ещё нет токенов‑ответов, решение уже сформировано внутри модели. 📊 Код доступен в репозитории https://github.com/ninjahawk/Subtext, а записанные сессии можно посмотреть в браузере https://ninjahawk.github.io/Subtext/. Валидация показала полное совпадение с референс‑реализацией Anthropic: топ‑5 совпадений на каждом слое/позиции, косинус‑похожесть 0.99998. Вопросы приветствуются.
Источник ↗🚀 Открытый ИИ растёт, но Anthropic пока не пострадал С ростом популярности открытых моделей искусственного интеллекта не наблюдается негативного влияния на компанию Anthropic. 🔄 По мнению экспертов, успех открытых моделей не отнимает ресурсы у передовых лабораторий; они представляют разные стадии одного жизненного цикла технологий. Таким образом, открытый ИИ и крупные исследовательские группы развиваются параллельно, каждый охватывая свою фазу развития.
Источник ↗📚 Новый метод защиты моделей от отравления при дообучении Автор опубликовал работу, в которой вместо поиска вредоносных данных предлагается ограничить дообучение модели подпространством, полученным из проверенных LoRA‑адаптеров. Это делает некоторые злонамеренные обновления геометрически недоступными. Пример: компания дообучает большую модель на пользовательских и внешних данных; небольшое количество отравленных примеров может добавить скрытую реакцию на определённую фразу. Другой пример — локальный помощник, который адаптируется к пользователю, но его изменения ограничены только теми поведениями, которые уже представлены в надёжном наборе адаптеров. 🔒 В эксперименте подход проверяли на 196 публичных LoRA‑адаптерах, включая специально разработанные адаптивные атаки. Успешность атак резко упала, а полезная адаптация почти полностью сохранилась для задач, покрытых пулом адаптеров. Текст статьи, код и результаты доступны публично: https://arxiv.org/abs/2607.05300 и https://github.com/infinition/z-manifold. Автор приглашает исследователей попытаться обойти защиту.
Источник ↗🚀 Microsoft сокращает расходы на ИИ, опираясь на собственные модели Компания объявила о снижении бюджета на разработки в области искусственного интеллекта и переходе к использованию собственных моделей вместо сторонних решений. Это делает Microsoft последним крупным игроком из Кремниевой долины, который уменьшает вложения в ИИ. Сокращение расходов направлено на оптимизацию затрат и повышение эффективности внутренних технологий. Microsoft будет развивать и интегрировать свои модели в продукты и сервисы компании.
Источник ↗🤖 Тренеры новых ИИ признаются: вместо общения с моделями они используют чат‑ботов Работники, нанятые для обучения новых систем искусственного интеллекта, сказали New Scientist, что вместо реальных диалогов с ИИ они просто заставляют общаться другие чат‑боты. Эксперты называют это «инбридингом ИИ» и предупреждают, что такой подход может снизить мощность и полезность будущих моделей ⚠️
Источник ↗🧩 Новый подход к моделированию глубины Исследователи из Robbyant (подразделение Ant Group) представили LingBot‑Depth 2.0, где при masked depth modeling вместо случайного блочного дропаут‑а используется маска недействительных измерений сенсора (зоны с бликами, прозрачными поверхностями и безтекстурными участками). В рамках контроля инициализации энкодера сравнили несколько предобученных бэкбонов, оставив неизменными все остальные параметры и объём данных. По результатам, инициализация LingBot‑Vision превзошла остальные на почти всех тестах при ViT‑L и на большинстве при ViT‑g; лишь DINOv2 сохраняет небольшое преимущество на наборах Hammer. Команда сообщает о лучшем RMSE на 7 из 8 блок‑маскированных и разреженных бенчмарков и на 6 из 8 реальных конфигураций камер в трёх наборах захвата (Hammer D435/L515/ToF, ClearGrasp D415/D435 и собственный набор D415/D435/D455). На прозрачных объектах ClearGrasp показатели RMSE в DIODE‑Indoor почти вдвое лучше, чем в версии 1.0. Веса модели Depth 2.0 не опубликованы, но открыты четыре Vision‑бэкбона под лицензией Apache‑2.0 на GitHub https://github.com/robbyant/lingbot-vision, где также доступна статья и интерактивные демонстрации точечных облаков. 🚀
Источник ↗