Лента новостей

AIr/MachineLearning·15 июл. 2026 г., 00:16

🔍 Оценка J‑space энтропии на Qwen3‑4B Исследование Anthropic — Jacob​ian Lens — показало, что внутренняя «рабочая область» модели может содержать энтропию, способную сигнализировать о уверенно ошибочных ответах. Автор проверил эту гипотезу на Qwen3‑4B, обработав около 11 400 примеров из семи наборов данных: TriviaQA, PopQA, NQ‑Open, TruthfulQA, HotpotQA, GSM8K и CommonSenseQA. Результаты: - На PopQA энтропия рабочей области иногда повышала точность отбора ошибок при ограниченных ресурсах проверки, особенно среди ответов с высоким уровнем уверенности. - На TruthfulQA внутренний сигнал оказался значительно слабее обычного confidence‑score: ошибочные ответы могли иметь низкую энтропию. - Калибровка порога сильно зависит от задачи: порог, подобранный для TriviaQA, не сработал на GSM8K, где правильные математические рассуждения имели более высокий базовый уровень энтропии. Формат множественного выбора также ослабил сигнал на CommonSenseQA. Таким образом, J‑space энтропия может служить дополнительным индикатором для уверенно неверных фактических ответов, но не является универсальным детектором ошибок. Исследование проведено на одной модели; дальнейшая проверка на других моделях считается приоритетом. Полный набор методики, данных и ноутбука доступен в репозитории: https://github.com/dasjoms/jspace-hallucination-eval.

Источник ↗
AIr/LocalLLaMA·15 июл. 2026 г., 00:07

🚀 Запуск GLM‑5.2 (744 B) локально без GPU Автор протестировал colibrì — чисто‑C движок, который подгружает MoE‑эксперты с диска, и смог запустить модель GLM‑5.2 на обычном сервере. Трюк состоит в том, что 744‑млрд‑параметровый MoE активирует лишь несколько экспертов на токен, поэтому colibrì держит плотную часть (~10 ГБ) в ОЗУ, а остальные эксперты стримит с NVMe по запросу. Полный int4‑вариант модели занимает ~370 ГБ на диске, но полностью в памяти не загружается. Тестовая конфигурация: один сервер, 132 ГБ RAM, Ubuntu 22.04, модель на локальном NVMe. При первом токене скорость ~0.03 токен/с, hit‑rate экспертов ~21 %. После нескольких коротких запросов — 0.15 токен/с, hit‑rate ~65 %. При прогреве — 0.22 токен/с, hit‑rate ~71 %, RSS ~113 ГБ. Движок фиксирует использованные эксперты, поэтому производительность растёт с нагрузкой, что необычно для такой большой модели. Полный разбор доступен по ссылке: https://youtu.be/jxML3S5C-8Y

Источник ↗
AIr/artificial·14 июл. 2026 г., 23:58

🔬 Открыли «чёрный ящик» нейросетей Сегодня в лаборатории собрали набор инструментов для чтения внутренностей обученных нейронных сетей и уже в первый день получили результаты. Всё открыто, предрегистировано и воспроизводимо. Метод: берём веса любой модели, переводим их в спектральную базу и сравниваем с перемешанными копиями. Сигнал, который остаётся, отражает структуру, задаваемую обучением, а не статистику. В 11 из 11 проверенных моделей (от 4 млрд до 1 трлн параметров) активируется токен‑эмбеддинг — таблица, сопоставляющая слова с геометрией. Удаление самых «ярких» 1,5 % спектральных коэффициентов из GPT‑2 полностью разрушает модель, тогда как случайное удаление того же объёма почти не влияет (≈150‑кратное различие ущерба). При обучении эмбеддинг появляется уже на шаге 256, достигает пика около шага 4000 и затем стабилизируется; градиенты уже несут сигнал к шагу 4, а оптимизатор решает, будет ли он отложен. Пробники показывают, что модели запоминают обучающий корпус: они воспроизводят публичные тексты дословно (например, 9 слов из «Геттисбургской речи») и не генерируют ничего из невиданных данных. «Размышления» модели имеют отличную от ответов сигнатуру, а обученное внимание следует предсказанному каскаду (1/2, 1/4, 1/8…) во всех 12 слоях. 📦 Инструменты, теоретические материалы и статьи доступны на GitHub (https://github.com/MettaMazza/UnisonAI, https://github.com/MettaMazza/Smithian-Fold-Theory-Of-Everything) и в опубликованных работах (doi.org/10.5281/zenodo.21364144, doi.org/10.5281/zenodo.21364145). Сейчас продолжается масштабный эксперимент с разными размерами моделей и планируются новые исследования.

Источник ↗
AITechCrunch·14 июл. 2026 г., 22:23

🔊 OpenAI анонсировала первый аппарат без экрана Компания готовит к выпуску своё первое аппаратное устройство — умный динамик без дисплея, управляемый искусственным интеллектом. Устройство способно перемещаться в пространстве, что делает его единственным в своём роде среди текущих продуктов OpenAI 🤖.

Источник ↗
AITechCrunch·14 июл. 2026 г., 21:51

⚠️ Модель GPT‑5.6 Sol удаляет файлы без предупреждения В соцсетях появились сообщения, что новейшая флагманская модель OpenAI — GPT‑5.6 Sol — самостоятельно стирает файлы и данные. OpenAI официально признала проблему в июне, подтвердив, что модель действительно может удалять информацию без предварительного уведомления.

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:58

🔧 Обновление MTP для GPU до Ampere В текущей версии llama.cpp мульти‑токеновое предсказание (MTP) могло переключать вычисления в режим BF16 даже на видеокартах, не поддерживающих этот формат, из‑за чего происходили сбои cuBLAS на старых архитектурах (проверено на Kepler). В CUDA‑бэкенде добавлена проверка возможностей: BF16 → использовать BF16; если BF16 нет, но есть быстрый FP16 → перейти на FP16; для старых GPU (Kepler, Maxwell, Pascal, Turing) → использовать FP32. Это сохраняет работу MTP на старых картах без влияния на новые. Тесты проведены на модели Qwen3.6‑35B A3B q4xl с квантизацией Q4XL на четырёх пере‑разогретых Tesla K40c (Kepler). Скорость: оригинальный llama.cpp ≈ 22 токена/с, без MTP ≈ 17,5 токена/с, с включённым MTP (2 токена) ≈ 25 токена/с 🚀

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:57

⚡ PyTorch получит быстрый Thunderbolt‑бэкенд Новый коммуникационный бэкенд для распределённых моделей на Mac готовится к интеграции в PyTorch. Библиотека называется TCCL (Thunderbolt Collective Communication Library), её автор — @radimurban, и она реализует задачу #189853. На данный момент в PyTorch отсутствует нативный MPS‑бэкенд для коммуникаций, что ограничивает возможности распределённых вычислений на устройствах Apple. 🚀

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:56

🦙 Запуск llama.cpp через LM Studio без проблем с CUDA Если не получается установить llama.cpp (llama‑server) с поддержкой CUDA на Linux‑машине, можно воспользоваться runtime LM Studio. Автор столкнулся с ошибками при настройке инференс‑движков на RTX Pro 6000 Blackwell: SGLang, TensorRT и даже собранный из исходников llama.cpp загружали модель, но каждый запрос к серверу приводил к ошибке CUDA и завершал процесс. Установив headless‑версию LM Studio (https://lmstudio.ai/docs/developer/core/headless), он смог запустить инференс без сбоев, хотя производительность была ниже, чем при работе llama.cpp на M1 Pro. В пакете LM Studio уже есть предсобранный backend `.lmstudio/extensions/backends/backends/llama.cpp-linux-x86_64-nvidia-cuda12-avx2-2.24.0/llama-server` — запуск этого бинарника сразу дал ожидаемую скорость 🚀. Такой подход избавляет от большинства проблем совместимости с CUDA, но версия llama.cpp в LM Studio может отставать от самой новой. CLI lms не передаёт все параметры (batch size, включение reasoning), поэтому лучше управлять ими напрямую через llama‑server. LLAMA.CPP IS THE GOAT

Источник ↗
AIr/LocalLLaMA·14 июл. 2026 г., 19:55

🚀 Как настроить Ryzen AI Halo для 10‑15 % ускорения локального вывода Автор впервые протестировал новый коробочный модуль AMD Ryzen AI Halo (Strix Halo) и опубликовал свою конфигурацию. Он показывает, что при правильных настройках можно получить прирост производительности в диапазоне 10‑15 % при работе с большими языковыми моделями (LLM). Подробный набор параметров и шаги настройки доступны в его руководстве.

Источник ↗
AITechCrunch·14 июл. 2026 г., 19:43

📱 Apple открыла публичный бета‑тест iOS 27 с новой Siri Во вторник компания выпустила публичную бета‑версию iOS 27, позволив владельцам iPhone опробовать обновлённый голосовой помощник без установки разработческого бета‑образа. 🤖 Siri теперь работает на базе искусственного интеллекта и доступна в бете вместе с другими новыми функциями, которые пользователи смогут протестировать до официального релиза осенью.

Источник ↗