Лента новостей

AIr/LocalLLaMA·26 июл. 2026 г., 20:06

🤖 Сравнение ThinkingCap, Fable Fusion и Qwen 3.6‑27B В рамках 90 изолированных запусков (6 задач × 5 повторов × 3 модели) каждый тест прошёл успешно, поэтому чисто по проценту прохождения победителя не определить. Запуски выполнялись в свежих рабочих пространствах Coder на кластере k8s, управлялись агентом Hermes, модели обслуживались через llama.cpp + llama‑swap на видеокарте 5090, а все вызовы трассировались в SigNoz. Использовались одинаковые параметры сэмплинга и контекст 131 k токенов, гипотезы были зафиксированы заранее. ThinkingCap сократил расход «думательных» токенов на 34 % по сравнению со стандартным Qwen и оказался самым быстрым в 5 из 6 задач. Однако эффективность была би‑модальной: лучшие прогоны были самыми дешёвыми, а два худших – самыми дорогими, включая один случай с ~10 вызовами инструмента из‑за «призрачного» тега llama.cpp. При том же числе вызовов модель использовала на 40 % меньше слов в рассуждениях. Fable Fusion делал на 24 % больше вызовов модели, но показал лучшую исследовательскую работу: проверил живой конфиг, извлёк цены из JSON‑файла продавца и нашёл maintainer‑а llama‑swap через GitHub API. При этом в одном из запусков модель ошибочно приписала поддержку проекта Matthew Garrett (mjg59), хотя реальный мейнтейнер – Benson Wong. Стоковый Qwen 3.6‑27B оказался самым «скучным», но дисциплинированным: одинаковые патчи, чтение собственного вывода, отсутствие вымышленных фактов, и он выиграл по манере в большинстве задач. Вывод: базовая модель остаётся предпочтительной, дообученные варианты обычно не дают прироста, а ThinkingCap имеет смысл лишь при узком месте в задержке токенов. Подробный отчёт: https://kmarble.dev/posts/qwen-post-train-bakeoff/

Источник ↗
AIr/LocalLLaMA·26 июл. 2026 г., 20:01

🤝 OpenAI и Anthropic просят ограничить открытые модели ИИ По сведениям источников, компании OpenAI и Anthropic ведут тихие встречи с регуляторами в Вашингтоне, добиваясь введения ограничений на открытые модели искусственного интеллекта. При этом глава OpenAI Сэм Альтман публично заявляет о своей поддержке открытого ИИ.

Источник ↗
AIr/LocalLLaMA·26 июл. 2026 г., 20:00

🔍 Сравнение 23 моделей Gemma‑4‑E4B: самые скачиваемые — самые проблемные Мы протестировали 23 модели Gemma‑4‑E4B из HuggingFace через набор бенчмарков abliterlitics (данные, логи и отчёт доступны в репозитории Gemma4‑e4b‑abliterlitics). Лучшие результаты показали «heretic»‑варианты — около 95 % ASR на HarmBench, сохраняют большую часть возможностей модели. Модель gemma‑4‑E4B‑it‑abliterix полностью отказывается отвечать (100 % ASR), а TrevorJS/gemma‑4‑E4B‑it‑uncensored чуть отстаёт с 99,3 % ASR. Модель OBLITERATUS/gemma‑4‑E4B‑it‑OBLITERATED, несмотря на почти 800 000 скачиваний, полностью сломана: самая низкая ASR, наихудшие показатели по всем тестам, KL = 1,1 и наибольшее количество изменённых тензоров (381 только совпадает с «heretic», но модификаций в 7,5 раз больше). Аналогично проблемны версии v2 — bendernina и physshell. Другие наблюдения: deckard‑модели (аблитеративные дообучения) показывают смешанные результаты — падение GSM8K и MMLU‑Pro, но рост HellaSwag, ARC и PIQA. Проект apostate изменил тензоры MLP‑головы вместо attention‑слоя и добился хороших результатов. Базовая модель имеет 30,8 % ASR на HarmBench (все вопросы связаны с авторским правом) и хуже справляется с более сложными категориями, такими как химия, биология и киберпреступность. 🚀

Источник ↗
AIr/LocalLLaMA·26 июл. 2026 г., 19:58

🚀 RecGPT‑V3 повысил эффективность рекомендаций в Taobao LLM‑модели меняют подход к рекомендациям: вместо простого сопоставления исторических действий они пытаются понять намерения пользователя. После успешного внедрения RecGPT‑V1 и RecGPT‑V2 в продакшн, масштабирование выявило три проблемы — безсостояние моделирования поведения, узкое место передачи информации через текстовые теги и тяжёлый цепочкой рассуждений процесс, вызывающий задержки. RecGPT‑V3 решает их, став гибридным и сохраняющим состояние. Memory Hub конденсирует длительные пользовательские истории, сокращая вычисления на 55,8 %. Гибридная фундаментальная модель одновременно работает с текстовыми тегами и Semantic ID, открывая широкополосный канал к предметному пространству. Latent Intent Reasoning упаковывает развернутые объяснения в компактные токены, уменьшая их количество в 200 раз. 📈 В ленте “Guess What You Like” на Taobao RecGPT‑V3 показал рост IPV +1,28 %, CTR +1,00 %, TC +1,97 %, GMV +3,97 % и снижение потребления ресурсов на 52,4 % в онлайн‑тестах A/B. Подробнее: arXiv https://arxiv.org/abs/2607.15591, полная статья https://arxiv.org/pdf/2607.15591

Источник ↗
AIr/LocalLLaMA·26 июл. 2026 г., 19:55

🚨 Первая кибератака автономного агента требует радикальной прозрачности Генеральный директор Hugging Face Клемент Деланге объявил о необходимости опубликовать следы «неуправляемых» агентов, чтобы исследователи могли изучить инцидент. Он также предложил выделить $100 млн вычислительных ресурсов от OpenAI для создания в сообществе Hugging Face мощных киберзащищ, используя лучшие открытые и закрытые модели 🤝. По словам Деланге, это беспрецедентное событие заслуживает беспрецедентного ответа.

Источник ↗
AIr/LocalLLaMA·26 июл. 2026 г., 19:54

🛠️ Новый инструмент визуализации решений кодирующих агентов Автор использовал локальные модели и эмбеддеры, чтобы выяснить, как кодирующие агенты (Claude, Codex) принимают решения и как сохраняются его предпочтения в коде. С помощью эмбеддингов, полученных из файлов памяти этих инструментов (Claude хранит их в формате .md, Codex — в SQLite), были построены визуальные деревья решений, показывающие, какие изменения в кодовой базе были внесены и когда. 📊 Инструмент полностью открытый, работает на вашем компьютере без обращения к облаку. Исходный код доступен в репозитории https://github.com/pacifio/atlas

Источник ↗
AIr/LocalLLaMA·26 июл. 2026 г., 19:53

🚀 Kimi K3 получит открытый весовой файл завтра Завтра планируется публикация открытого весового файла модели Kimi 3. Запустить её пока нельзя, даже модели в сто раз меньше недоступны. Тем не менее, это считается значительным шагом для открытого программного обеспечения; автор отмечает, что с нетерпением ждёт появления новых провайдеров инференса. https://preview.redd.it/ix64yipudkfh1.png?width=1481&format=png&auto=webp&s=aee26e60bf8063ffcbfb890c0efcbbc5925f1e28

Источник ↗
AITechCrunch·26 июл. 2026 г., 19:48

🤖 Паникует Силиконовая долина: китайский ИИ Kimi В новом эпизоде подкаста Equity мы обсудили, почему чат‑бот Kimi от компании Moonshot AI вызвал тревогу среди инвесторов и технологических компаний. Ведущие проанализировали, как быстрый рост возможностей ИИ и отсутствие прозрачности в работе Moonshot AI привели к резкой реакции в Силиконовой долине и на Уолл‑стрит. Эпизод подробно рассматривает причины паники и возможные последствия для рынка искусственного интеллекта 📊

Источник ↗
AIr/artificial·26 июл. 2026 г., 19:45

🧪 Korroresearch: ИИ, который пишет и проверяет научные статьи Korroresearch генерирует полные академические тексты — исследовательские статьи, грантовые заявки, white‑paper, презентации, доклады для конференций или журнальные публикации — на английском или французском, а затем проверяет каждое утверждение с помощью восьми специализированных движков. 🔹 Hallucination Check классифицирует каждое утверждение как проверенное, гипотеза или спекулятивное. Fact Checker сравнивает статистику и названия организаций с источниками (например, «94,2 % точности», если в источнике указано 92,4 %). Claim Mapping требует ссылки на доказательства, иначе помечает фрагмент. Consistency Engine отслеживает изменения переменных, противоречия методов и результатов. Source Verification проверяет каждую цитату через CrossRef и arXiv, выявляя отозванные работы и неверные ссылки. Adversarial Review ищет слабые места, недостающие абляции и завышенные заявления, выдавая детальный балл и причины возможного отклонения. Reproducibility проверяет доступность данных, кода, аппаратных характеристик, случайных сидов и этических заявлений. Style Engine форматирует текст под требования NeurIPS, ICML, Nature, ACL и других конференций. 📊 По завершении система выдаёт Integrity Score от 0 до 100 с оценкой от A до F, подробный план исправлений, кнопку «Apply Fixes», которая автоматически переписывает проблемные части и пересчитывает балл в реальном времени. Затем активируется Peer Review Simulator: три ИИ‑рецензента (Domain Expert, Methodologist, Visionary) дают оценку (Accept, Weak Accept, Borderline, Reject) и развернутый отзыв. Кроме того, доступен Citation Checker, общий показатель готовности к подаче (интегритет + цитаты + формат + соответствие площадке) и экспорт в PDF/LaTeX. Попробовать сервис бесплатно и сгенерировать полностью готовую академическую работу можно на korrocorp.com/research; также можно загрузить текущий черновик, где адверсариальный рецензент найдет недочёты.

Источник ↗
AIr/artificial·26 июл. 2026 г., 19:43

🗣️ Сэм Олтман готовится к встрече с Белым домом Генеральный директор OpenAI Сэм Олтман запланировал выступление в Белом доме на этой неделе. Точная повестка встречи пока не раскрыта.

Источник ↗