Лента новостей
🤖 Робот‑учитель в школах Северного штата Нью-Йорк Школьный округ в северной части штата Нью-Йорк объявил, что уже этой осенью в классах появится гуманоидный робот, выступающий в роли учителя. Робот будет работать совместно с педагогами, помогая проводить занятия и демонстрировать новые способы подачи материала. Это первый подобный эксперимент в данном районе, направленный на оценку эффективности роботизированных помощников в образовании.
Источник ↗🧠 Agents‑A1‑4B: масштабирование горизонта, а не параметров Новая модель Agents‑A1‑4B (возможно Qwen3.7‑4B) опубликована командой InternScience. Файлы модели и GGUF доступны на Hugging Face: https://huggingface.co/InternScience/models?search=a1-4b. В тестах модель показала конкурентные результаты как среди плотных моделей (~4 B параметров), так и среди MoE‑моделей (35 B‑3 B). На наборе BrowseComp она набрала 74.1, а на XBench‑DS‑2510 — 90.0, что является лучшим показателем. Полные результаты benchmark'ов: BrowseComp — 47.2 66.8 61.0 67.9 74.1 75.5 XBench‑DS‑2510 — 73.0 90.0 77.0 71.0 82.0 86.0 Seal0 — 31.5 45.8 41.4 38.7 49.6 56.4 GAIA — 58.3 95.1 59.8 78.6 82.5 96.0 Engineering & Research Tasks: SciCode — 16.1 29.6 37.7 35.8 29.9 44.3 MLE‑Lite — 7.6 22.7 24.2 34.9 34.9 43.9 LiveCodeBench‑V6 — 55.8 59.6 76.2 78.1 59.1 76.2 FrontierScience‑Research — 1.7 33.3 2.5 2.9 5.0 40.0 Instruction Following: IFBench — 59.2 69.1 70.2 64.4 54.1 80.6 LongBench‑v2 — 50.0 52.1 59.0 57.7 59.6 60.2 IFEval — 89.8 94.8 91.9 91.3 88.4 94.8 General & Scientific Agentic Tasks: τ²‑Bench — 79.9 78.2 81.2 79.0 74.5 79.8 VitaBench — 22.0 40.3 31.9 35.6 23.0 38.8 MatTools — 10.9 49.3 21.0 15.9 34.1 47.1
Источник ↗⚠️ Генеративный ИИ — инженерный провал В недавнем обзоре эксперты назвали развитие генеративного искусственного интеллекта инженерным провалом. По их оценкам, проект оценивается в триллион долларов, но эффективность его реализации остаётся шокирующе низкой 💸.
Источник ↗🚀 RL‑посттренинг на 14 Mac‑ах в 4 странах Исследователи из Pluralis Research провели первый в истории RL‑посттренинг, где все генераторы рол‑аутов работали на обычных потребительских Mac‑ах, подключенных к открытой сети Интернет. Для эксперимента использовали 14 компьютеров в четырёх странах; каждый из них выполнял int8‑инференс через MLX, а градиентные обновления bf16 делал один сервер B200, находящийся на другом континенте. Синхронизация происходила только через облачное хранилище Cloudflare R2 по обычному домашнему интернету, без специализированных дата‑центров. Система PULSE передавала лишь изменения весов (≈0.5 % от всех int8‑значений), что составляло около 82 МБ вместо 9 ГБ. DPPO‑подобный фильтр исключал ≈0.3 % токенов с слишком большим отклонением вероятностей. На тесте PaperSearchQA (медицинский поиск в диалоговом режиме) модель Stoa улучшила показатели: покрытие pass@1 выросло с 29 % до 63 %, а частота успешного поиска — с 22 % до 84 % 📈. Модель научилась использовать встроенный инструмент. Сейчас Stoa требует, чтобы модель помещалась в память одного Mac, а обучение ограничено одним кластером. Pluralis уже завершил предобучение Pluralis‑8B на сотнях потребительских GPU через открытый интернет (проект Agora). Совмещение Agora и Stoa может перенести как инференс, так и обучение крупных моделей на распределённое потребительское оборудование, которое уже превышает вычислительные мощности современных дата‑центров. Код: https://github.com/PluralisResearch/stoa Подробный материал: https://pluralis.ai/blog/rl-post-training-on-macs Твит‑нить: https://x.com/Pluralis/status/2077419672987668667
Источник ↗🤖 Открытая модель Soofi S 30B‑A3B от немецкого консорциума Немецкое исследовательское объединение представило Soofi S 30B‑A3B — открытый языковой ИИ‑модель с 30 млрд параметров, показавшую лучшие результаты в тестах на английском и немецком языках. Модель полностью обучалась на облачной инфраструктуре Deutsche Telekom в Мюнхене и использует гибридную архитектуру, активируя лишь часть из 31,6 млрд параметров при обработке каждого токена, что обеспечивает стабильную пропускную способность даже при очень длинных контекстах. Тренировочный набор данных был преднамеренно смещён в сторону немецкого языка, благодаря чему Soofi S опережает всех полностью открытых конкурентов в оценках как по немецкому, так и по английскому.
Источник ↗🔧 Microsoft закрыл рекордные 570 уязвимостей В рамках ежемесячного обновления Patch Tuesday компания исправила 570 уязвимостей — самое большое число за всю историю релизов. 🤖 По заявлению Microsoft, большинство находок было получено с помощью технологий искусственного интеллекта, что позволило охватить весь спектр её продуктов.
Источник ↗🔧 Открыт симулятор ранжирования X 2026 года Разработчик создал локальный детерминированный инструмент XViral, который моделирует утёкший в 2026 году алгоритм ранжирования контента X. Программа написана на Python, использует оркестрацию LLM и воспроизводит многоголовый процесс оценки, описанный в опубликованном коде и чек‑поинтах. Репозиторий доступен по адресу https://github.com/ninjahawk/XViral. Главным техническим вызовом стало отсутствие точных параметров подсказок для встроенных судей Grok. Несмотря на то, что X оставил только схемы ввода‑вывода, автор использовал локальный цикл LLM, чтобы эмулировать эти «чёрные ящики» и отслеживать, как алгоритм выделяет системные сигналы. Симуляция раскрывает несколько особенностей алгоритма: фиксированный «Slop Score» — целое число, измеряющее повторяющиеся шаблоны, и отдельный quality_score; экстремальное снижение веса отрицательных сигналов, где один пользовательский репорт даёт штраф −369, полностью перекрывая +0.5 за обычный лайк; а также девятнадцать независимых предсказательных голов, оценивающих ответы, длительное время просмотра, отключения звука и прочее перед агрегированием в финальный рейтинг «Для вас». Код опубликован под свободной лицензией, что позволяет изучать формулы оценивания, запускать собственные тексты через локальный конвейер или адаптировать логику эмуляции судей для других платформ. Автор приглашает сообщество обсудить использование LLM для имитации закрытых слоёв алгоритмов и способы более точной калибровки весов под реальное распределение.
Источник ↗🔊 OpenAI анонсировала первый аппарат‑спикер OpenAI представила свой первый физический продукт — переносной динамик без экрана, предназначенный для работы в качестве AI‑компаньона. Устройство будет мобильным, без дисплея, и ориентировано на голосовое взаимодействие с пользователем.
Источник ↗⚖️ Meta использовала собственный ИИ с ошибками для выбора сотрудников, подлежащих сокращению, утверждает иск В иске, поданном против компании, говорится, что Meta применяла внутренний инструмент искусственного интеллекта, который имел известные недостатки, для определения работников, которых планируют уволить. По заявлению истцов, алгоритм некорректно оценивал показатели сотрудников, что привело к несправедливому отбору людей для массовых сокращений.
Источник ↗⚡ AI‑агенты могут платить в биткоинах Одна из главных нерешённых задач инфраструктуры ИИ — автономные платежи. Кредитные карты требуют подтверждения личности, что невозможно масштабировать при тысячах микроплатежей в час. В 2026 году Lightning Labs выпустила набор инструментов, позволяющий агентам платить через сеть Bitcoin Lightning. Ключевой элемент — протокол L402: агент отправляет HTTP‑запрос, получает ответ 402 «Payment Required» с Lightning‑инвойсом, автоматически оплачивает его через lnget и получает доступ менее чем за секунду, без участия человека. По сравнению с решениями на стейблкоинах (Coinbase Agentic Wallets с USDC, Stripe x402) микроплатежи в Lightning обходятся в доли сатоши, тогда как транзакции в Ethereum или Solana стоят от центов до долларов. Инструментарий также поддерживает MCP, позволяя агентам на базе Claude или GPT напрямую взаимодействовать с Lightning‑узлом. Проект находится в ранней стадии, но инфраструктура уже доступна в открытом исходном коде. Подробнее: https://davidebtc186.substack.com/p/ai-agents-are-starting-to-pay-in
Источник ↗