Qwen 3.8 27B локально на двух RTX 5070 Ti: 262к контекста и Claude Code без облака
Qwen 3.8 27B локально на двух RTX 5070 Ti: пять конфигураций vLLM, максимальный контекст 262 144 токена и подключение модели к Claude Code. Тестирую не облако и не серверные H100, а сборку, которую реально собрать дома: Ryzen 5 3600, две RTX 5070 Ti по PCIe 4.0 x8 и RTX 3090 в нижнем слоте через чипсет.
Мой бенчмарк меряет железо и инференс, а не качество самой модели: скорость чтения запроса (префилл), подтверждённый контекст через поиск иголки в стоге сена на 10, 50 и 90 процентах длины, падение скорости на длинном промпте, исправность сборки после агрессивного квантования кэша и агентская траектория на 26 ходов.
Что получилось по конфигурациям: 262 144 токена контекста ценой скорости, 65 536 токенов с моделью целиком и живым vision, MTP со спекулятивным декодированием и приростом скорости 82 процента, 170 912 токенов без сжатия кэша и вариант с третьей картой на llama.cpp. Отдельно показываю, почему turbo quant 4 бита вместе с MTP пока даёт мусор, сколько стоит ответ в строгом JSON-формате и где у vLLM поздно включается кэш префикса.
В видео:
- железо стенда и почему PCIe x4 через чипсет портит картину
- сводная таблица: 5 конфигураций, 6 прогонов
- префилл и подтверждённый контекст: как я проверяю, что контекст реально работает
- MTP: где даёт плюс 82 процента, а где ломает генерацию по схеме
- NVFP4 от Unsloth против FP8 и Q4 в llama.cpp
- vLLM против llama.cpp на трёх видеокартах: layer и tensor распределение слоёв
- Claude Code на локальной Qwen 3.8: реальная задача по 1С, 4 часа против 22 минут на облаке
- энергопотребление: 470 Вт под нагрузкой, 2 кВт за прогон
- какую конфигурацию брать под кодового агента, под картинки и под большой документ
- живой запуск: генерация нейронки распознавания цифр на Keras
Главный вывод: 27B на двух картах по 16 гигабайт работает и задачу дописывает до конца, но местами упирается в таймауты харнеса и в скорость префилла. Рабочий сценарий — держать локальную модель как запас на время, пока восстанавливаются лимиты облачной подписки, а не как полную замену.
Мой бенчмарк меряет железо и инференс, а не качество самой модели: скорость чтения запроса (префилл), подтверждённый контекст через поиск иголки в стоге сена на 10, 50 и 90 процентах длины, падение скорости на длинном промпте, исправность сборки после агрессивного квантования кэша и агентская траектория на 26 ходов.
Что получилось по конфигурациям: 262 144 токена контекста ценой скорости, 65 536 токенов с моделью целиком и живым vision, MTP со спекулятивным декодированием и приростом скорости 82 процента, 170 912 токенов без сжатия кэша и вариант с третьей картой на llama.cpp. Отдельно показываю, почему turbo quant 4 бита вместе с MTP пока даёт мусор, сколько стоит ответ в строгом JSON-формате и где у vLLM поздно включается кэш префикса.
В видео:
- железо стенда и почему PCIe x4 через чипсет портит картину
- сводная таблица: 5 конфигураций, 6 прогонов
- префилл и подтверждённый контекст: как я проверяю, что контекст реально работает
- MTP: где даёт плюс 82 процента, а где ломает генерацию по схеме
- NVFP4 от Unsloth против FP8 и Q4 в llama.cpp
- vLLM против llama.cpp на трёх видеокартах: layer и tensor распределение слоёв
- Claude Code на локальной Qwen 3.8: реальная задача по 1С, 4 часа против 22 минут на облаке
- энергопотребление: 470 Вт под нагрузкой, 2 кВт за прогон
- какую конфигурацию брать под кодового агента, под картинки и под большой документ
- живой запуск: генерация нейронки распознавания цифр на Keras
Главный вывод: 27B на двух картах по 16 гигабайт работает и задачу дописывает до конца, но местами упирается в таймауты харнеса и в скорость префилла. Рабочий сценарий — держать локальную модель как запас на время, пока восстанавливаются лимиты облачной подписки, а не как полную замену.
Комментарии
Подписаться на ответы
Инфостарт бот
Сортировка:
Древо развёрнутое
Свернуть все
Для отправки сообщения требуется
регистрация/авторизация
Прямая ссылка:
https://infostart.ru/video/w2770102/