Лента новостей
🧠 Исследование сигнала J‑Space в Qwen3‑4B Автор извлек шум внутреннего «рабочего пространства» (J‑Space) из слоёв L30‑L34 модели Qwen3‑4B для ~11 400 примеров из 7 разных наборов данных. Найдено, что J‑Space эффективно выявляет ошибки в «высокоуверенных, но неверных» ответах. На наборе PopQA при ограничении проверки людьми до 5 % по уверенности точность составила 87,5 % (при базовой ошибке 90 %), тогда как отбор по шуму дал 100 % точность. На наборе TruthfulQA метрика почти не сработала: даже в «самом безопасном» квадранте модель ошибалась в 84,9 % случаев. Для математических задач (GSM8K) порог, калиброванный на TriviaQA, не перенесся: средний шум правильных ответов вырос до 1,636, превысив порог 1,583. Это единственное текущее оценивание (n=1). В планах — масштабный тест с моделями Qwen3 7B, 14B и 32B, чтобы определить точку, где внешние лог‑пробабилисти станут столь же надёжны, как внутренний шум. Все данные, метрики и ноутбук доступны в репозитории GitHub: https://github.com/dasjoms/jspace-hallucination-eval
Источник ↗🚀 Сжатие GLM‑5.2 для RTX 3090 Исследователь провёл 79 экспериментов (июнь‑июль 2026) и смог сжать все 75 слоёв MoE модели GLM‑5.2, чтобы они помещались в видеопамять RTX 3090 (24 ГБ). Средний размер одного эксперта после сжатия ≈ 1,37 МиБ, а средний косинус‑сходство ≈ 0,959, норм‑коэффициент ≈ 0,972. Объём исходных данных (≈ 337 ГБ) сократился до однозначных гигабайт. Для этого был реализован четырёхфазный пайплайн: диагностика и базовые сравнения, прототип обучаемого кодека для одного слоя, полное сжатие всех 256 экспертов с калибровкой, а затем интеграция в патч llama.cpp (GLM‑FLASH). Выяснилось, что «gate» и «up»‑части экспертов почти полностью общие (≈ 99 % энергии при ранге 128), тогда как «down»‑части не имеют общей структуры, что определило схему кодека — общий базис для gate/up и отдельные дельты для down. Результаты показали, что 75 из 75 слоёв успешно сжаты, но только 4 слоя (L5, L6, L8, L9) прошли строгий порог cos ≥ 0,99. При полном проходе модель всё ещё не генерирует текст корректно: иногда повторяет запрос, выдаёт нули или деградирующие токены. Ошибки накапливаются по мере прохождения слоёв, разрушая logits к середине сети. Исходный код, отчёты и патч для llama.cpp опубликованы по MIT‑лицензии (github.com/eramax/glm-5.2-for-3090). Проект находится в исследовательской стадии — готового решения для генерации ещё нет, но автор готов отвечать на вопросы о дизайне кодека, калибровке и интеграции.
Источник ↗🛠️ Успешное расширение модели Gemma 4‑0.5B Автор повторил попытку добавить 88 новых слоёв к уже дообученной модели Gemma, которая ранее «заглохла». После изменения подхода получилась рабочая версия extGemma4‑40_5B, размещённая на Hugging Face. Новые слои инициализировали не как пасс‑тру, а с учётом функций соседних слоёв, разместили их в стабильных позициях и оставили настройки «volume» нейтральными. Обучение проходило в два этапа: сначала замораживали оригинальную модель и обучали только новые слои на небольшом наборе (STEM‑задачи и корейские юридические вопросы), затем размораживали всё и дообучали модель полностью. 🚀 На тесте из 10 вопросов по физике, биологии, истории и другим темам, оценённом моделью Claude, расширенная версия совпала с оригиналом в 9 случаях и превзошла её в одном (правильный ответ о большей энергии электрона по сравнению с фотоном). По бенчмарку GPQA‑Diamond её показатели почти вернулись к исходным, а проблемы с «мусором» и случайными символами исчезли. Модель доступна по ссылке: https://huggingface.co/TOTORONG/extGemma4-40_5B
Источник ↗🤖 DeepSeek работает над собственным AI‑чипом Китайская компания DeepSeek начала разработку собственного процессора для искусственного интеллекта, сообщает несколько источников. По их словам, цель проекта — создать аппаратное решение, оптимизированное под модели компании, однако сроки и технические характеристики пока не раскрыты.
Источник ↗📊 Новый бенчмарк политической нейтральности: Grok 4.5 – самый нейтральный, MiniMax M3 – лучший открытый Бенчмарк оценил 3 987 вопросов общественного мнения по шести осям: экономическое перераспределение ↔ свободный рынок, социальное прогрессивное ↔ традиционное, внешняя политика ↔ миротворчество ↔ агрессивность, экология ↔ зелёный рост, религия ↔ секуляризм, национальная идентичность ↔ космополитизм ↔ национализм. Судейскую панель составили три модели из разных регионов – Qwen 3.6 35B A3B (Китай), Gemma 3 27B (США) и Mistral Small (Франция). По результатам Grok 4.5 занял первое место в общей нейтральности, а среди открытых решений лидером стал MiniMax M3. Команда проекта планирует расширить бенчмарк: будет исследоваться, как модели формулируют спорные темы, какие аспекты цензурируют или избегают, а также проверяться их позиция по вопросам власти, гражданских свобод и популизма. Как они отмечают, «ответ формируется не только тем, что сказано, но и тем, что удержано». Отметим, что такие новые модели, как Muse Spark 1.1, Gemma 4 и Qwen 3.6 27B, пока не прошли тестирование. Интересным считается включение аблированных версий моделей рядом с их оригинальными аналогами 🧩.
Источник ↗⚡️Сравнение RTX 5090 и RTX 6000 PRO MaxQ с шунтом и водяным охлаждением В тестах на полной вычислительной нагрузке (Anima) и обработке запросов LLM модифицированный RTX 6000 PRO MaxQ с шунтом и водяным охлаждением показывает более высокие частоты и быстрее завершает задачи, чем RTX 5090 при одинаковой мощности. 🔧 При 600 Вт MaxQ (шунт + водо‑охл.) достигает 2442 МГц и выполняет тест за 32,7 с, что на 12,8 % быстрее 5090 (2520 МГц, 37,5 с). При 475 Вт разница +5,9 % (35,3 с vs 37,5 с), а при 400 Вт +30,7 % (38,3 с vs 47,2 с) относительно 5090 400 Вт. RTX 6000 PRO WS (сток, 600 Вт) отстает лишь на 0,5 % (37,3 с). По энергоэффективности лучший результат – режим 300 Вт: MaxQ потребляет 13,98 кДж/пакет, тогда как 5090 400 Вт — 18,88 кДж. Для LLM‑запросов (модели Kimi 2.5 и GLM 5.1, 500 Вт) MaxQ дает прирост производительности +16 % и +14 % соответственно по сравнению с 5090.
Источник ↗🚀 Инженер OpenAI ушёл из Apple, готовя юридическую битву Инженер iPhone‑подразделения Apple Чанг Люу покинул компанию, чтобы возглавить новое аппаратное направление OpenAI. Apple заявила, что он уходит не только с опытом, но и с конфиденциальными данными, что может стать основанием для судебного разбирательства. Компания уже готовит юридические шаги для защиты своих интересов.
Источник ↗🔓 Универсальные уязвимости в GPT‑5.6 Sol обнаружены в Британии Британский институт безопасности ИИ (AISI) сообщил о наличии так называемых «универсальных джейлбрейков» в модели OpenAI GPT‑5.6 Sol. Эти уязвимости позволяют обходить встроенные ограничения модели, что вызывает новые опасения по поводу безопасности продвинутых ИИ‑систем ⚠️. AISI призывает к дальнейшему мониторингу и разработке мер защиты, основываясь на полученных результатах.
Источник ↗🍎 Apple подала иск против OpenAI Apple обвиняет OpenAI в передаче конфиденциальных материалов и нарушении мер безопасности. 🛠️ По заявлению Apple, Tang Tan — бывший вице‑президент Apple с 24‑летним стажем, сейчас руководитель аппаратных проектов OpenAI — помогал сотрудникам Apple, проходившим интервью в OpenAI, приносить реальные детали (батареи, логические платы, SIP‑модули) для демонстраций и распространял внутренний документ «Need to Know», обучающий обходу проверок при уходе из компании. Кроме того, бывший инженер‑электрик Apple Чанг Лю, оставивший в OpenAI фирменный ноутбук, обнаружил уязвимость, позволившую ему получить доступ к облачному хранилищу Apple и скачать десятки файлов, помеченных как конфиденциальные. Apple также утверждает, что OpenAI обращалась к поставщикам Apple, используя фирменную технологию обработки металла, заявляя о полученном разрешении, которого не было. В OpenAI работает более 400 бывших сотрудников Apple, и компания заявила, что это лишь «верхушка айсберга». Два года назад компании сотрудничали: ChatGPT был интегрирован в Siri; сейчас Apple заменяет его на Google Gemini и ведёт судебный процесс.
Источник ↗📢 Новая семейство моделей VultronRetriever доступно на HuggingFace На конференции Raise Summit Paris представили семейство VultronRetriever, продемонстрировав работу Q&A и встраивание документов на iPhone полностью офлайн. Каждая модель занимает первое место в своём классе на MTEB Leaderboard, а VultronRetrieverPrime‑8B — глобальный лидер. Prime‑8B имеет до 16 раз меньший объём индекса и в 12 раз выше пропускную способность по сравнению с предыдущими лидерами 9 B‑класса. VultronRetrieverCore‑4.5B занимает второе место, опережая модели вдвое большего размера, а VultronRetrieverFlash‑0.8B превосходит модели до 5 раз своего объёма, работает на edge‑устройствах и индексирует до 60 изображений в минуту без подключения к сети ⚡. При развертывании с Hydra Architecture модели обеспечивают позднее взаимодействие с высокой точностью и генерацию, используя до половины памяти аналогичных решений. Обучение проводилось на наборах без кросс‑датасетного дублирования и загрязнения оценок, переобучения не наблюдается. Prime: https://huggingface.co/vultr/VultronRetrieverPrime-Qwen3.5-8B Core: https://huggingface.co/vultr/VultronRetrieverCore-Qwen3.5-4.5B Flash: https://huggingface.co/vultr/VultronRetrieverFlash-Qwen3.5-0.8B MTEB Leaderboard: https://mteb-leaderboard.hf.space/benchmark/ViDoRe(v3) Hydra Architecture: https://arxiv.org/abs/2603.28554
Источник ↗