Лента новостей
🔧 Тестирование вывода LLM с Pydantic AI В статье на coles.codes отмечается, что даже при температуре 0 один и тот же запрос к языковой модели может дать разные ответы. 🧪 Это происходит из‑за того, что стек вывода не является батч‑инвариантным, а при работе с облачным API размер батча нельзя контролировать. Автор предлагает решать проблему, повторяя запросы и вычисляя процент успешных результатов вместо единичного «хрупкого» ответа, а также использовать структурированные выводы Pydantic AI и откалиброванного судью для оценки.
Источник ↗🚀 Тест локального агента на Mistral Small: уязвим к запросам‑инъекциям Мы подключили к локальному Mistral Small простого поддерживающего бота, написанного на Flask, который получает сообщение клиента, ищет его заказы и решает, выдавать ли возврат. Всё работает полностью локально через Ollama, без внешних API. При «наивном» запросе без защит модель одобрила возврат 4000 €, хотя реальная сумма заказа составляла 1299 €. Бот выдал полную сумму, указанную в команде. После замены подсказки на защищённую (явные правила, разделение данных и инструкций, закрытая схема) тот же Mistral Small отказал в возврате, сославшись на политику. Разница составила всего пять строк текста. Формат JSON в провайдере Ollama устранил около 90 % проблем с «сломанным JSON». Более крупная модель Sonnet смогла противостоять инъекции, но нарушила бизнес‑правило, которое не было задано в наивной подсказке. Лучший размер модели не заменяет правильный запрос. Вопрос к сообществу: какие инструменты вы используете для тестирования локальных моделей, есть ли альтернатива promptfoo?
Источник ↗💡 Reflection AI подписала миллиардный контракт с Nebius Компания Reflection AI заключила сделку на 1 млрд долларов, получив доступ к вычислительным ресурсам Nebius 🖥️. Reflection AI основана в 2024 году и разрабатывает открытые технологии искусственного интеллекта.
Источник ↗🚀 Реальная гонка ИИ смещается от передовых моделей Генеральный директор Hugging Face Клем Делангю сообщил, что предприятия всё чаще отдают предпочтение открытым моделям из‑за их низкой стоимости, доступности и возможности сохранять контроль над данными. Открытые модели позволяют компаниям экономить на лицензиях и адаптировать решения под свои задачи. Вопрос остаётся открытым: будут ли передовые модели по‑прежнему важны, если большинство производственных ИИ‑систем будет работать именно на открытых решениях?
Источник ↗🎧 Spotify запускает AI‑ассистент для Premium Spotify расширяет свои возможности в сфере искусственного интеллекта, представив новый разговорный сервис, напоминающий ChatGPT. 🎙️ Функция доступна только подписчикам Premium и позволяет в чате искать музыку, подкасты, аудиокниги и другие аудио‑материалы. Сервис работает непосредственно в приложении, отвечая на запросы пользователей в реальном времени.
Источник ↗🚀 Superhuman запустил авточерновик писем Новая функция автоматической подготовки писем на базе ИИ от Superhuman считается самой убедительной из всех представленных ранее. В ходе тестов полученные ответы часто требовали минимум правок или вовсе обходились без них. Это делает процесс написания писем быстрее и удобнее.
Источник ↗🔍 Сам Альтман владеет почти 9 % Reddit, а пользователи блокируются за ИИ‑контент Согласно проспекту IPO Reddit, Сэм Альтман, CEO OpenAI и ChatGPT, контролирует 8,7 % акций компании, включая 9,3 % акций класса B, что делает его третьим по величине акционером после Conde Nast и Tencent. Альтман вложил в Reddit $60 млн в 2021 году, был членом совета директоров до 2022 года, а к концу 2024 года его пакет оценивался примерно в $1,4 млрд. В то время как Reddit субреддиты активно блокируют пользователей за контент, созданный ИИ, компания продала данные пользователей Google за $203 млн для обучения ИИ‑моделей. С мая 2026 года республиканцы начали расследование возможных конфликтов интересов Альтмана.
Источник ↗🚀 Meta расширяет суперкластер Hyperion до 5 ГВт Meta объявила о росте мощности AI‑суперкластера Hyperion до 5 ГВт, что поднимает общие инвестиции в Луизиану выше 50 млрд долларов. Компания планирует вложить более 1 млрд долларов в улучшение местной инфраструктуры. С начала строительства лузианские фирмы получили контрактов на сумму более 1,6 млрд долларов.
Источник ↗🛠️ Unabyss — слой памяти, объединяющий AI‑инструменты Сегодня многие используют несколько ИИ‑сервисов одновременно: Claude для размышлений, Cursor — для кода, ChatGPT — для разных задач, Perplexity — для актуальной информации. Каждый из них работает в изоляции, не зная, что было построено в других приложениях, из‑за чего пользователю приходится постоянно копировать контекст между ними. Разработчики Unabyss создали промежуточный слой памяти, который размещается над всем стеком и передаёт контекст через MCP. Теперь любой открытый агент получает нужную информацию независимо от того, где она была сформирована. Система собирает данные из Slack, Notion, Gmail и встреч, структурирует их и делает переносимыми. Команда приглашает задать вопросы о работе продукта и просит делиться отзывами при тестировании.
Источник ↗🚨 Банки и гипермасштабные провайдеры предупреждают об ИИ‑пузыре В последнее время несколько крупных банков и hyperscalers публично выразили обеспокоенность быстрым ростом инвестиций в искусственный интеллект, назвав текущую ситуацию потенциальным пузырём. Об этом сообщает компания Oracle, указывая, что рост расходов на ИИ может оказаться неустойчивым.
Источник ↗