Лента новостей

AIr/LocalLLaMA·16 июл. 2026 г., 10:15

🚀 Qwen3.6‑35B‑A3B на RTX 3060: 30 токенов/с Конфигурация LM Studio позволяет запускать модель MoE Qwen3.6‑35B‑A3B с полным контекстом 262 K на видеокарте RTX 3060 12 ГБ + 32 ГБ DDR5, достигая около 30 токенов в секунду. Главный приём — вынести веса экспертов FFN в оперативную память CPU, оставив внимание и KV‑кеш на GPU. Поскольку при каждом токене активируется лишь ~3 млрд параметров (A3B), вычисления на CPU остаются недорогими, и пропускная способность сохраняется. Ключевые параметры: длина контекста 262 144, offload GPU 40/40 слоёв, 40 слоёв MoE‑весов принудительно на CPU, 8 экспертов, пул потоков CPU 6, batch size 512, KV‑кеш на GPU ON, Flash Attention ON, квантизация K/V F16 (можно переключить на q8_0), mmap ON, Keep Model in Memory OFF, Speculative Decoding OFF, температура 0.6‑1.0, Top K 20, Top P 0.95. Результат — ~30 токенов/с при полном 262 K окне контекста, что удобно для локальной автоматизации и постоянных AI‑задач. Конфигурацию можно сочетать с открытой библиотекой локального хранилища Lyzr Cognis, работающей без Docker и облака, обрабатывающей факты за <300 мс и передающей нужный пользовательский контекст обратно в модель без лишних затрат VRAM. 😊

Источник ↗
AIr/LocalLLaMA·16 июл. 2026 г., 10:11

🚀 Nemotron‑Labs‑3 Puzzle 75B работает на двух RTX 3090 Запущена модель NVIDIA‑Nemotron‑Labs‑3‑Puzzle‑75B‑A9B (W4A16) на 2 × RTX 3090 с полным контекстом 262 000 токенов и параллелизмом N=4. Технически использован quant https://huggingface.co/danielrmay/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-W4A16, драйвер с патчем aikitoria BAR1‑P2P, аппаратура – 2 × RTX 3090 (SM 8.6), PCIe Gen4 ×8, без NVLink. Запуск через образ vllm/vllm-openai:cu129‑nightly dev1060 (9e57de71) с параметрами docker, включая gpu‑memory‑utilization 0.965, kv‑cache‑dtype int8_per_token_head и др. Показатели: при N=1 декодирование = 93.8 токен/сек, предзаполнение ≈ 3660 токен/сек; при N=4 суммарно = 255 токен/сек (по 69 токен/сек на поток), p50 TTFT = 0.61 с, без OOM, полная длина контекста = 262 K, KV‑пул int8 = 278 K токенов, GPU‑потребление = 267/287 MiB, recall = 52 K, 847 × 293 = 248 171, «all but 9» = 9, чистый вызов инструмента qwen3_coder. PIECEWISE CUDA‑графы повышают скорость декодирования до 88+ токен/сек, а custom‑all‑reduce улучшает производительность на +8 % при N=1 и +6 % при N=4.

Источник ↗
AIr/LocalLLaMA·16 июл. 2026 г., 10:05

🔓 Возможность разблокировать Nvidia CMP 170HX Исследователи нашли уязвимость в процессоре безопасности Falcon, которая может превратить видеокарту CMP 170HX в полноценный A100. CMP 170HX — модифицированная версия A100 с ограниченными вычислительными ресурсами и 80 ГБ памяти, предназначенная исключительно для майнинга криптовалют; она вышла незадолго до краха крипторынка. В статье, опубликованной в прошлом месяце, подробно описан эксплойт; существовал репозиторий с доказательством концепции (cmpunlocker), сейчас недоступен. Разблокировка памяти пока не воспроизведена. Обычный A100 стоит более $5 000, а CMP 170HX продавался менее $200 до распространения новости. При успешной разблокировке можно получить A100 80 ГБ примерно за $1 000.

Источник ↗
AIr/LocalLLaMA·16 июл. 2026 г., 10:00

🚀 Qwen3.6 : 35B работает на NVIDIA P40 со скоростью 80 токенов/с Запущена модель Unsloth Qwen3.6‑35B UD Q4_K_M с контекстом 100 000 токенов на одной видеокарте NVIDIA P40 (24 ГБ) через форк TurboQuant от TheTom для llama.cpp. Достигнутая «всплесковая» скорость — около 80 токенов в секунду. В конфигурации включён TurboQuant, но K не снижен до Turbo2, чтобы сохранить качество агента. Рассуждения отключены из‑за постоянных зависаний в цикле, а визуальный модуль не загружался, что сэкономило примерно 300 МБ видеопамяти и позволило разместить весь контекст. Запуск осуществляется командой: `llama-server --host 0.0.0.0 --port 11436 --hf-repo unsloth/Qwen3.6-35B-A3B-MTP-GGUF --hf-file Qwen3.6-35B-A3B-UD-Q4_K_M.gguf --ctx-size 100000 --parallel 1 --threads 12 --threads-batch 12 --batch-size 2048 --ubatch-size 512 --n-gpu-layers 99 --n-cpu-moe 0 --flash-attn on --no-mmap --jinja --alias qwen3.6:35b --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --cache-type-k q8_0 --cache-type-v turbo2 --spec-type draft-mtp --spec-draft-n-max 2 --no-mmproj --reasoning off` Автор ищет дополнительные «вуду‑оптимизации» для llama.cpp или P40 и приглашает сообщество поделиться советами.

Источник ↗
AIr/LocalLLaMA·16 июл. 2026 г., 09:56

🚀 Grok Build открыт под лицензией Apache 2.0 SpaceXAI выпустила проект Grok Build как открытый код. Он представляет собой набор для кодирующего агента и текстовый пользовательский интерфейс (TUI). 🖱️ Инструмент работает в полноэкранном режиме, поддерживает интерактивность мышью и легко расширяется. Исходный код доступен в репозитории xai-org/grok-build.

Источник ↗
AIr/LocalLLaMA·16 июл. 2026 г., 09:55

🚀 Inkling – лучший открытый весовой модель США Сейчас модель Inkling от Thinking Machines Lab занимает первое место среди открытых весовых моделей США. Она опережает все отечественные конкуренты, в том числе NVIDIA Nemotron Ultra, и находится примерно на пятом месте в мировом рейтинге всех открытых моделей. Это значительный шаг США в конкуренции с Китаем в области открытых весовых моделей. Поздравляем команду Thinking Machines с достижением 👍

Источник ↗
AITechCrunch·16 июл. 2026 г., 00:00

💼 Microsoft обучает продавцов критиковать конкурентов По сообщениям, в Microsoft проводят обучение сотрудников продаж, чтобы они умело сравнивали собственные модели ИИ с решениями OpenAI и Anthropic. ⚙️ В рамках этих инструкций акцент делается на том, что внутренние модели компании работают эффективнее и обходятся дешевле, чем предложения конкурентов. Цель — позиционировать разработки Microsoft как более выгодный вариант для клиентов.

Источник ↗
AITechCrunch·15 июл. 2026 г., 18:04

🤖 Thinking Machines представила открытую модель Inkling Компания Thinking Machines анонсировала свою первую откры‑модель Inkling, сделав шаг против универсальных решений в сфере ИИ. Это первое публичное подтверждение работы компании после полутора лет разработки AI‑инфраструктуры, о которой почти не сообщалось. Inkling теперь доступна для широкой аудитории, открывая новые возможности для разработчиков.

Источник ↗
AIr/technology·15 июл. 2026 г., 17:50

🚀 Дорогой AI из США: стартапы переходят на китайские модели Искусственный интеллект становится одной из самых быстрорастущих статей расходов для компаний. Некоторые стартапы уже ищут способы экономии, отказываясь от дорогих американских решений в пользу более доступных китайских моделей. Переключение позволяет снизить затраты без изменения основных функций ИИ.

Источник ↗
AIr/technology·15 июл. 2026 г., 17:49

⚖️ Сотрудники Meta подали иск из‑за применения ИИ при сокращениях Сотрудники компании Meta подали коллективный иск, утверждая, что искусственный интеллект использовался при отборе работников для увольнения. По их словам, в начале этого года было внедрено мониторинговое приложение, которое передавало данные в систему ИИ, а затем эта система определяла, кого уволить. Истцы требуют пересмотра процесса сокращений и компенсацию за нарушение их прав.

Источник ↗