Лента новостей

AIr/LocalLLaMA·24 июл. 2026 г., 23:30

📱 Gemma 4 26B A4B работает на iPhone 17 Pro через модель‑пейджинг Команда Noema, основанная автором сообщения, продемонстрировала работу версии Q4_K_M модели Gemma 4 26B A4B на iPhone 17 Pro, используя функцию Overfit в приложении Noema. При этом «неэкспертные» веса находятся в RAM, а «экспертные» части модели читаются с SSD ⚙️. Такой подход позволяет запускать крупные модели на смартфоне, хотя скорость генерации токенов и время первого вывода (TTFT) снижаются. При начальном запросе в 699 токенов получены следующие показатели: скорость предварительной загрузки 34.4 tk/s, время предзаполнения 20.34 сек, скорость декодирования 3.5 tk/s. Полный ответ был получен за ~6 минут, но оказался точным. Технология может быть полезна, когда важна точность ответа, а не мгновенность, а также пригодна для ноутбуков с небольшим объёмом оперативной памяти. Подробнее — noemaai.com/overfit, модели — huggingface.co/NoemaAI-labs/Noema-Overfit

Источник ↗
AIr/LocalLLaMA·24 июл. 2026 г., 23:24

🚀 Stripe рассматривает покупку OpenRouter за $10 млрд Stripe ведёт переговоры о приобретении OpenRouter — стартапа, создающего маркетплейс моделей искусственного интеллекта. По данным The Wall Street Journal, потенциальная стоимость сделки оценивается примерно в 10 млрд долларов. В ближайшее время планируется запуск проекта ClosedRouter; основателям передают поздравления.

Источник ↗
AIr/LocalLLaMA·24 июл. 2026 г., 23:19

🔧 Статистически без потерь: новая квантовая компрессия LLM Исследователи представили подход к квантованию больших языковых моделей, который сохраняет точность без типичных потерь. В отличие от методов GPTQ и AWQ, дающих практичную компрессию, но являющихся «lossy», и полностью безпотерных техник, не ускоряющих вывод, новая работа вводит три понятия безпотерного сжатия. Первое – task‑lossless компрессия, сохраняющая точность zero‑shot бенчмарков в пределах естественной дисперсии при агрессивных битовых ширинах. Второе – distribution‑lossless, требующее почти идентичного распределения вероятностей следующего токена; для оценки предлагается метрика Expected Acceptance Rate (EAR), где EAR ≥ 0.99 означает 99 % совпадения. Третье – доказательство закона γ²‑дисперсии: симметричная квантовка увеличивает шум в γ² раз по сравнению с асимметричной, делая асимметрию необходимой для distribution‑lossless, но не для task‑level. С помощью SLQ – слой‑по‑слой нелинейной асимметричной квантовки с широким поиском битовой ширины – достигнуты: task‑lossless сжатия ниже 4 бит/параметр (до 3,3 бит), distribution‑lossless в среднем 5‑6 бит/параметр и ускорение вывода от 1,7 до 3,6 × по сравнению с FP16 при оптимизированных ядрах 🚀. Полный текст доступен на arXiv (https://arxiv.org/abs/2605.02404) и в PDF (https://arxiv.org/pdf/2605.02404). Код будет опубликован в репозитории GitHub (https://github.com/IST-DASLab/SLQ). Работа опубликована два месяца назад; о ней упомянуло RedHat AI, а в статье встречаются ссылки на llama.cpp и GG.

Источник ↗
AITechCrunch·24 июл. 2026 г., 22:26

🚀 AI‑лаборатория Prentis ищет $100 млн инвестиций Prentis — новая AI‑лаборатория, соучредителями которой являются Рейд Хоффман и Марк Пинкус, находится в переговорах о привлечении 100 миллионов долларов. 🔧 Компания ставит ставку на автоматизацию рутинных компьютерных задач, полагая, что этот сценарий скоро превзойдёт программирование как главное применение искусственного интеллекта.

Источник ↗
AIr/MachineLearning·24 июл. 2026 г., 21:58

🚀 Новый компилятор превращает граф вычислений в веса трансформера без обучения Автор создал компилятор, который принимает обычный граф вычислений, описанный в Python, и генерирует веса трансформера в архитектуре Phi‑3. Полученный чекпоинт загружается в Hugging Face без кастомного кода и без параметра trust_remote_code. В процессе не требуется обучение модели – всё происходит «из коробки». Подробный обзор и описание работы компилятора доступны по ссылке https://ood.dev/posts/torchwright-intro/. 🛠️ Репозиторий с двенадцатью готовыми примерами находится на GitHub: https://github.com/physicsrob/torchwright. Автор отмечает, что аналогичные «ручные» веса уже реализовывались в проектах RASP и Tracr, но они не поддерживали обычный Python и не ориентировались на стандартную архитектуру.

Источник ↗
AIr/MachineLearning·24 июл. 2026 г., 21:57

🚀 Открыт новый open‑source AI‑агент AutoDev Studio, который экономит от 7 % до 75 % стоимости по сравнению с «холодным» запуском Claude Code на репозиториях до ~82 k строк кода. 🛠️ В тестах на 6 задач, требующих точной локализации изменений, холодный агент стоил $6.83 за 207 шагов, а AutoDev Studio ≈ $1.70 за тот же баг. Система один раз анализирует репозиторий, создавая постоянную базу знаний через статический анализ и локальный индекс эмбеддингов; последующие задачи используют эту базу, превращая поиск места изменения в простой запрос. Рабочий процесс включает PM‑агента, задающего уточняющие вопросы, Dev‑агента, пишущего код в отдельной ветке, QA‑агента, запускающего тесты, и отдельную модель‑ревьюера, после чего открывается реальный Pull Request и отображается канбан‑доска с учётом токенов и расходов. Система менее эффективна для небольших, легко находимых правок, где одноразовый агент обходится дешевле из‑за накладных расходов пайплайна; при сложном кросс‑функциональном баге она предложила более дешёвое, но узкое решение. AutoDev Studio поддерживает любые провайдеры (Anthropic, OpenAI, Groq, Gemini и др.), работает бесплатно и офлайн при использовании бесплатного уровня Groq, использует FastAPI, SQLite и имеет UI, тесты и CI. Репозиторий MIT‑лицензии доступен: https://github.com/krishagarwal314/autodev-studio.

Источник ↗
AIr/MachineLearning·24 июл. 2026 г., 21:53

📊 GPT‑5.5 набрал 10,6 % на тесте ActiveVision, люди — 96,1 % Новый арXiv‑проект представил benchmark ActiveVision, включающий 17 задач в трёх категориях, требующих повторного визуального восприятия, а не одной статической описания. На самом сложном уровне рассуждения GPT‑5.5 решил лишь 10,6 % заданий и не набрал баллов в 11 из 17 задач; Claude Fable 5 показал 3,5 % 🤖. Три человека‑испытателя в среднем достигли 96,1 % правильных ответов.

Источник ↗
AIr/MachineLearning·24 июл. 2026 г., 21:46

🔧 Один энкодер — семь задач Мы объединили семь отдельных классификаторов последовательностей в одну мульти‑головную модель на базе общего mmBERT‑small. В ней семь голов: бинарная инъекция (BCE), классификация документов (7‑классов), тип инструмента (14‑классов), операция инструмента (6‑классов), теги потока данных инструмента (3 × BCE, многометочный), маршрутизация намерений (5‑классов) и тип угрозы (7‑классов). При обучении строки содержат метки лишь для части задач, поэтому потери по отсутствующим задачам полностью маскируются. Мы добавили самопроверку, гарантирующую нулевые градиенты для таких задач, что выявило два скрытых бага. Для совместного обучения использовано около 5 тыс. синтетических и реальных многозадачных строк, а тестовые наборы состоят на 100 % из реальных данных. Результаты на отложенной выборке: инъекция F1 0.962, документы 0.980, тип инструмента 0.957, операция 0.945, теги 0.958, маршрутизация 0.916, тип угрозы 0.952. Модель и отдельные одно‑задачные варианты поставляются в квантованных edge‑сборках (ONNX INT8 + INT4 embeddings, 96 МБ); наихудший показатель отстаёт от FP32 лишь на 0.012. Отдельные модели показывают немного лучшие метрики, но unified‑модель делает один проход энкодера вместо до семи. Наименьший показатель — маршрутизация 0.916, вероятно, из‑за семантической неоднозначности классов. Если есть идеи, как улучшить эту задачу, пишите. Весы и метрики по головам доступны по ссылке: https://huggingface.co/patronus-studio

Источник ↗
AIr/technology·24 июл. 2026 г., 21:31

📊 Белый дом предлагает новый научный план В докладе «Science: A New Golden Age», подготовленном администрацией Трампа, предлагается перенаправить значительные средства из университетов в частный сектор, в частности в технологические компании. План ставит в приоритет развитие искусственного интеллекта и сокращение финансирования в области биологических наук. В документе указано о переносе «сотен миллиардов долларов» исследовательских средств в индустрию 🤖.

Источник ↗
AIr/technology·24 июл. 2026 г., 21:22

⚠️ Инцидент индийского трансгендера усиливает критику Meta AI «Pervert Glasses» Трансгендерный человек из Индии столкнулся с неприятным опытом при использовании носимых устройств Meta, названных «Pervert Glasses». Этот случай вызвал рост негативных реакций в соцсетях. Журналист Карен Ребело сообщает о случаях злоупотребления, связанных с применением этой технологии Meta. 🚨

Источник ↗