Облачные vs Локальные модели ИИ: что выбрать?

03.08.26

Интеграция - Нейросети

В последние годы спор «облако или локалка» стал одним из самых горячих в мире работы с нейросетями. Давайте разберемся.

В 2026 году спор «облако или локалка» уже не про идеологию. Это практический выбор инструментов под конкретные задачи, деньги, приватность и контроль. Давайте разберем все по полочкам - без хайпа и с учетом реалий.

Кстати, эта тема родилась благодаря частым вопросам и утверждениям. Вчера вечером я решил расставить все точки над и. Поехали.

 

Краткая сравнительная таблица

Критерий Облачные модели Локальные модели
Максимальное качество Чуть выше в среднем Уже на уровне (Kimi K3 и др.)
Приватность Данные уходят в облака Данные никуда не уходят
Стоимость Постоянная (токены / подписка) Разово за железо + электричество
Зависимость от интернета Полная Нет
Контроль и цензура Почти отсутствует Полный
Удобство запуска Включил и пользуешься Нужна настройка и обслуживание
Гибкость пайплайнов Ограниченная Очень высокая
Масштабирование Легко Сложнее

 

 

1. Стрельба из танка по мухам

Большинство повседневных задач отлично решаются хорошими локальными моделями. Использовать топовый облачный «танк» для таких задач часто избыточно и дорого.

 

Уже сейчас 80-90 % задач закрываются локально

 

Большинство повседневных задач отлично решаются локальными моделями:

  • Написание, правка и рефакторинг кода
  • Работа с текстом
  • Анализ своих документов и RAG
  • Генерация идей, планов и структуры
  • Простые и средние рассуждения
  • Творчество и ролевые сценарии
  • Автоматизация рутины через пайплайны

Оставшиеся 10-20 % - это сложные многошаговые рассуждения, гигантский контекст, максимальная мультимодальность и задачи, где нужна самая свежая «мозговитость» топовых закрытых моделей.

 

 

2. Мастерство приходит с опытом

На локалке можно делать сотни итераций почти бесплатно. Это резко ускоряет развитие навыка работы с промптами, температурами, системными промптами и архитектурой. В облаке каждый серьезный эксперимент стоит денег и упирается в лимиты.

 

 

3. Безопасность контекста. Внутренние риски

Один из самых сильных аргументов в пользу локальных моделей. Коммерческие секреты, внутренняя документация, персональные, медицинские или финансовые данные лучше никогда не отправлять на чужие сервера - даже если провайдер обещает «мы ничего не сохраняем».

 

Юридические и законодательные требования

В медицине, финансах, госсекторе данные часто вообще нельзя отправлять наружу. Здесь локалка или частное облако - практически единственный легальный вариант.

 

 

4. Неожиданная реальность

Облачные провайдеры могут в любой момент изменить поведение модели, усилить цензуру, поменять системный промпт или ввести новые ограничения. Вы получаете сюрприз без предупреждения. На локалке версия модели зафиксирована - поведение предсказуемо, пока вы сами его не меняете.

 

 

5. Свой коннект ближе к делу

Интернет - это точка отказа. Блокировки, аварии у провайдера, DDoS, «чебурнет» или просто плохой Wi-Fi - и облако становится недоступным. Локальная модель работает всегда, пока жив ваш компьютер или сервер.

 

 

6. Вариативность и пайплайны

На локалке вы можете запускать несколько моделей одновременно, строить сложные пайплайны (маленькая модель для классификации → большая для генерации → третья для проверки), экспериментировать с квантованием, MoE, спекулятивным декодированием и разными архитектурами.

В облаке вы обычно ограничены тем, что предлагает провайдер. Локально вы ограничены мощностями.

 

 

7. Говори то, что мне нравится

В облачных моделях вы почти не можете убрать фильтры и цензуру. На локалке - полный контроль: версии без цензуры, свой системный промпт, дообучение и тонкая настройка под ваши задачи и ценности.

 

 

8. Железо и стоимость владения

Локалка требует нормальной видеокарты (или нескольких). Это разовые, но ощутимые вложения + электричество + шум/тепло. При активной работе локалка часто выходит дешевле уже через 6-12 месяцев. Облако - платишь только за использование или абонентку, но счет растет вместе с объемом.

П.С. Кстати, мое оборудование, которое я купил для локалки, подорожало за полгода на 15-20%

 

 

9. Качество топа (актуально на август 2026)

Разрыв между лучшими открытыми и закрытыми моделями сильно сократился.

Kimi K3 (Moonshot AI) - первая открытая модель в классе ~3T параметров, с 1M контекстом и нативной мультимодальностью. Веса выложены в открытый доступ в конце июля 2026. По многим бенчмаркам она занимает первое место среди моделей с открытыми весами и вплотную конкурирует с топовыми закрытыми (Claude Fable 5, GPT-5.6 Sol и др.), а в отдельных задачах даже обгоняет часть из них.

Другие сильные открытые модели (GLM-5.x, DeepSeek V4 Pro, MiniMax M3 и др.) тоже значительно подтянулись.

Важный нюанс: запустить Kimi K3 полноценно «на одном компьютере» все еще крайне тяжело - нужна серьезная серверная инфраструктура. Для комфортной локальной работы на 1-2 машинах по-прежнему лучше подходят модели класса 70B-120B+ в хороших квантах. Но много задач можно закрывать и на моделях до 35B.

 

 

10. Обслуживание и простота

Облако - включил и пользуешься.

Локалка - нужно следить за драйверами, квантованием, версиями, VRAM и иногда чинить падения. С Ollama, LM Studio, llama.cpp, vLLM и SGLang порог входа сильно снизился, но полностью «нулевым» он не стал.

 

 

11. Масштабирование

Если моделью пользуются несколько человек или крутятся параллельные агенты и пайплайны - облако масштабируется почти мгновенно. На локалке быстро упираетесь в железо.

 

 

Вывод: гибридный подход - самый зрелый

Не нужно выбирать «только облако» или «только локалка».

Самая практичная стратегия выглядит так:

  • Локальные модели - для 80-90 % работы, приватных данных, экспериментов и повседневных задач.
  • Облачные модели - точечно, когда действительно нужна максимальная мощность или специфические возможности, которых пока нет в открытом доступе.

Так вы получаете и свободу, и приватность, и качество, и адекватные расходы.

Выбирайте инструмент под задачу, а не наоборот. Локальные модели уже достаточно сильны, чтобы закрывать большую часть задач, а открытые гиганты вроде Kimi K3 показывают, что разрыв с закрытым топом продолжает стремительно сокращаться.

И да, задача кодинга уже разбилась, на каких языках локальные пишут, а пишут они уже на многих хорошо.

 

На этом статью завершаю, давно не писал и решил размяться ;)

Всем добра и удачи в работе!

Вступайте в нашу телеграмм-группу Инфостарт

LLM ollama llama.cpp lm studio kimi-3 cloude local guff open source локальные модели облачные модели

Вы можете заказать платную адаптацию этой статьи под ваши задачи на «Бирже заказов».

  • 0% комиссии — оплата напрямую исполнителю;
  • Исполнители любого масштаба — от отдельных специалистов до команд под проект;
  • Прямой обмен контактами между заказчиком и исполнителем;
  • Безопасная сделка — при необходимости;
  • Рейтинги, кейсы и прозрачная система откликов.

См. также

Инструментарий разработчика Нейросети Платные (руб)

Первые попытки разработки на 1С с использованием больших языковых моделей (LLM) могут разочаровать. LLMки сильно галлюцинируют, потому что не знают устройства конфигураций 1С, не знают нюансов синтаксиса. Но если дать им подсказки с помощью MCP, то результат получается кардинально лучше. Далее в публикации: MCP для поиска по метаданным 1С, справке синтакс-помощника и проверки синтаксиса.

15250 руб.

25.08.2025    67410    136    38    

143

SALE! %

Банковские операции Обмен с интернет-банком Мастера заполнения Нейросети Программист Бухгалтер Пользователь 1С:Предприятие 8 1C:ERP 1С:Бухгалтерия 3.0 1С:ERP Управление предприятием 2 1С:Управление холдингом 1С:ERP. Управление холдингом 1С:Комплексная автоматизация 2.х 1С:Управление нашей фирмой 3.0 1С:Управление торговлей 11 1С:Розница 3.0 Платные (руб)

Корректируйте банковские документы быстро и легко! Создайте правило обработки — и оно автоматически применится при загрузке выписки (отбор по любому реквизиту или регулярному выражению). Решение заполняет расшифровку платежа, комиссию эквайринга, подбирает ведомости на выплату зарплаты, помечает дубли из банка на удаление и многое другое. Доплачивать за алгоритмы не нужно — они включены в решение. Обработка работает при загрузке из файлов клиент-банка и через DirectBank. Новое — искусственный интеллект: модель приводит нестандартные назначения платежа к виду, понятному алгоритмам, а ИИ-ассистент прямо в 1С консультирует по решению и разбирает код правил и алгоритмов. Поддерживаются локальные и облачные OpenAI-совместимые модели — данные могут не покидать ваш контур.

15250 руб.

20.12.2024    18074    91    29    

80

Нейросети Программист 1С 8.3 Бесплатно (free)

Один проход модели по вопросу из 28 знаков стоит 631 296 умножений и 4,8 секунды. Столько берёт языковая модель на 21 920 параметров, посчитанная прямо в 1С средствами самой платформы. На ней разбираю по шагам, что стоит за каждым словом из модного словаря: токен, словарь, вектор символа, вес, слой, голова внимания, контекст, softmax, температура, KV-кэш. Отдельно про температуру - она вообще не про креативность и управляет выбором буквы уже после того, как модель закончила работу. Отдельно про галлюцинацию - показываю в цикле генерации место, куда физически невозможно вставить "не знаю". Плюс расчёт потолка для встроенного языка, замер цены размера модели и история про метод платформы, которого не существует.

20.08.2026    4445    nedomolkov.ivan    11    

20

Инструментарий разработчика Нейросети Программист 1С 8.3 Бесплатно (free)

Стенд, на котором языковую модель видно изнутри: настоящий трансформер посчитан с нуля на встроенном языке, без внешних компонент, ONNX, Native API и обращений наружу. Три кнопки: полный ответ с отчётом о числе умножений и секундах, один проход модели с вероятностями всех 36 символов алфавита столбиком, и разбор устройства - алфавит, номера токенов, размерности. Поле температуры показывает, что выбор буквы делает не сама модель, а код снаружи: при нуле ответ повторяется слово в слово, при пятёрке текст рассыпается на слоги. В комплекте два файла: модель на 21 920 параметров отвечает за 7-13 секунд, вчетверо более крупная примерно за 28. Веса лежат макетом внутри, скачивать и настраивать нечего. Знаний о мире у модели нет: она помнит сорок фраз про объекты 1С, и на вопрос вне этого набора отвечает бессмыслицей с той же уверенностью.

20.08.2026    3421    79    nedomolkov.ivan    0    

15

Нейросети Бесплатно (free)

Разбираем новые, более дешевые и эффективные паттерны работы внешнего 1С:Эксперта, а именно – прямое использование LLM-ассистентов и создание с их помощью инструментов для аудита производительности и нагрузочного тестирования. Показываем, как модели помогают анализировать таймауты и взаимные блокировки по технологическому журналу, проверять сложные запросы, а также находить неочевидные взаимосвязи между показателями загрузки оборудования. Рассказываем о создании скриптов для построения графиков по данным atopsar и для поиска и визуализации стеков горячих запросов, а также о создании неинвазивной оснастки для реалистичных нагрузочных и сценарных тестов без программирования на 1С. Отдельно разбираем антипаттерны и ограничения такого подхода. Делаем вывод, что LLM остается лишь помощником, не превращает джуна в сеньора, а ответственность за итоговый результат по-прежнему несет 1С:Эксперт.

10.08.2026    3446    jf2000    15    

17

Нейросети Программист Бесплатно (free)

SFT-адаптация Qwen/Qwen3.6-27B для разработки на платформе 1C:Enterprise: код на BSL, структура выгрузок BSL+XML, схемы XML и типовые практики конфигураций. Модель ориентирована на ассистента разработчика 1С: навигация по метаданным/XML-выгрузке, пояснение и правка BSL, следование внутренним стандартам кодирования, работа с открытыми кодовыми базами 1С.

03.08.2026    6513    andrew.ab    41    

20

Нейросети Программист Бесплатно (free)

Эта статья не столько про новую программу, сколько про путь: от желания немного улучшить чужой open-source проект — до создания собственного инструмента, который закрывает весь цикл работы с речью. Транскрибация, генерация статей и описаний через LLM, синтез аудиокниг — всё локально, в одном приложении. Исходники открыты, лицензия MIT.

29.07.2026    3065    Ibrogim    23    

30

Нейросети Программист Бесплатно (free)

Новые результаты теста топовых ИИ в вайбкодинге на 1С. Это продолжение прошлой статьи, где нейросети написали внешнюю обработку за 19 минут. Теперь же с этой же задачей справляются за 3–4 минуты. Прошло всего несколько недель. Что будет дальше?

24.07.2026    14612    top_1c    113    

40
Комментарии
Подписаться на ответы Инфостарт бот Сортировка: Древо развёрнутое
Свернуть все
1. infosoft-v 1110 03.08.26 10:42 Сейчас в теме
Отличная статья, спасибо.
Но такое ощущение, что это введение в цикл статей про локальные модели. Про развертывание, использование, настройки и т.д. Ведь так, это введение в цикл статей?
Vladimir-R; +1 Ответить
2. dsdred 4276 03.08.26 11:43 Сейчас в теме
(1) Рад что статья понравилась.
Пока не знаю цикл ли это будет, но хочу начать проект по ведению wiki по локальным моделям и возможно видео записывать буду. Про развертывание и сами модельки планирую в этом проекте писать.
nagimo; fan_club_chelsea; top_1c; infosoft-v; +4 Ответить
3. ixijixi 2160 03.08.26 16:48 Сейчас в теме
https://www.yottalabs.ai/post/kimi-k3-hardware-requirements-gpu-memory-2026
Архитектура Kimi K3 требует не менее 1,65–1,8 ТБ чистой видеопамяти (VRAM) только для удержания весов и базового контекста
Что, у кого-то есть такой бюджет?
4. dsdred 4276 03.08.26 17:34 Сейчас в теме
(3) слышал что Селектел будет разворачивать.
А так Сбер, яндекс, газпром и т.д.

Если фирма 1С например не будет спускать деньги на конкорды тогда вполне могли бы поднять и сделать напарник версия 2.
5. ixijixi 2160 03.08.26 19:05 Сейчас в теме
(4) Да я про нас, обычных смертных 😄
6. dsdred 4276 03.08.26 19:21 Сейчас в теме
(5) Для нас пока попроще модельки )) Qwen3.8 на следующей неделе веса выложат
Andrey_Timofeev; +1 Ответить
10. starik-2005 3301 04.08.26 11:38 Сейчас в теме
(6)
Флагманская модель Qwen3.8-Max содержит 2,4 триллиона
На чем гонять планируешь? )))
11. dsdred 4276 04.08.26 11:52 Сейчас в теме
(10) Посмотрим какие варианты будут. Если как кими 3 на максималках, то только повздыхаю ))
48. splxgf 11.08.26 16:14 Сейчас в теме
(6) Для людей попроще пока и Deepseek flash 0731 хватает. По качеству он подтянулся.
Не уверен что Qwen выдаст результат лучше.
39. Yashazz 4933 06.08.26 10:30 Сейчас в теме
(4) Не будут они это делать, не ждите. Они же хорошо понимают, что все эти БЯМ - игрушки на уровне песочницы и влажных мечтаний. Пощупали, потыркали на досуге - и айда обратно крыжики ковырять, минуса разгребать, печатные формы ваять и прочая. Ибо нефиг.
41. dsdred 4276 06.08.26 10:42 Сейчас в теме
(39) Кто не будет? 1С?
Про 1С я даже не сомневаюсь, они же не любят идти в ногу со временем.
42. Yashazz 4933 06.08.26 11:33 Сейчас в теме
(41) Да, я про 1С. Только дело не в "ногу со временем", а в хорошем понимании конъюнктуры. Они на самом деле всё правильно понимают. Крупный бизнес, серьёзные клиенты, т.е. то, на что 1С сейчас затачивается, не будут связываться с БЯМ. Это вот ларёчники-озонщики, "селлеры", мелкота - будут играться, мелко-средний бизнес будет пытаться что-то оптимизировать (потом огребёт, конечно, и поумнеет, но это потом). А крупняку - подчёркиваю, именно российскому (хотя и в ряде других стран эти явления имеют место), крупняку это не нужно в принципе. Почему - стопицот раз расписано, повторяться не стану.
Так что 1С как раз идёт в ногу с теми, с кем надо)
43. dsdred 4276 06.08.26 11:57 Сейчас в теме
(42) Ну не знаю. Спорно. Крупняки внедряют компьютерное зрение, обработку логов, транскрибацию и прочие вещи которые в ИИ делают.
И про ускорении разработки тоже многие интересуются в крупняках.
44. Yashazz 4933 06.08.26 12:11 Сейчас в теме
(43) Скажем так. Некоторые второстепенные, не особенно критичные для бизнеса моменты они, может, и попробуют сделать, используя БЯМ как сторонний инструмент. Но как ключевое, да в учётных системах, да где 1С - никоим образом.

Ускорение разработки - это чистый хайп, красивая сказочка-разводка, и это адекватные люди отлично понимают. Суммарно, итогово - использование БЯМ в разработке даёт больше негативных последствий, чем выигрыша, опять же, на загнивающем западе это уже начинают осознавать.
45. dsdred 4276 06.08.26 12:17 Сейчас в теме
(44)
(44)
Ускорение разработки - это чистый хайп, красивая сказочка-разводка, и это адекватные люди отлично понимают. Суммарно, итогово - использование БЯМ в разработке даёт больше негативных последствий, чем выигрыша, опять же, на загнивающем западе это уже начинают осознавать.

На западе доказано лишь что это инструмент для ускорения а не замены.
Мы в работе уже получили плюсы и ускорение. Сейчас занимаемся WIKI LLM, а это прям плюс со всех сторон. И документация, и контекст для разработки и частые вопросы для пользователей(к этому идем, чтобы прикрутить к чату)

Я лично вижу плюсы, у нас реальные кейсы закрываются.
46. Yashazz 4933 06.08.26 21:02 Сейчас в теме
(45) Это да. Документирование, анализ кода, упорядочение. Но не разработка как таковая. И про частые вопросы я ещё зимой придумал аналогичное, базу знаний для юзверей, и именно чатом)
47. dsdred 4276 07.08.26 09:35 Сейчас в теме
(46) Я всегда говорю, что написание кода это лишь одна капля из океана задач ))
7. starik-2005 3301 03.08.26 21:07 Сейчас в теме
задача кодинга уже разбилась на каких языках локальные пишут
Ничо не понял.
ЗЫ: Ornith-1.0 смотрел уже? Оно в опенкоде легко создает ХХХ параллельных агентов. В терминал бенч 2.х - 60+ баллов - +10 относительно базовой
8. dsdred 4276 03.08.26 21:58 Сейчас в теме
(7)Ornith-1.0 не смотрел еще.

Про кодинг. Немного поясню смысл текста.
Задача кодинга это не одна задача.
Кодинг на 1С
Кодинг на Go
Кодинг на JS
И тд

Какие то языки локальные закрывают хорошо.
Andrey_Timofeev; +1 Ответить
9. starik-2005 3301 04.08.26 11:35 Сейчас в теме
(8)
поясню
Это понятно. Явно не хватает запятой после "ь", поэтому показалось, что текст "сломан" Сейчас активно использую ИИ для создания рассказов, приходится запускать большой цикл с критиками, редакторами, корректорами и, собственно, писателями, при такой схеме даже 4-битные модели, которые на vLLM стабильно гонят до 180 т/с без MTP на моем железе, очень неплохо в итоге собирают "язык":
Звезда болела.

Лира Хонг поняла это задолго до того, как бортовой компьютер вывел последнее число на экран. Она стояла у иллюминатора и видела то, что не мог измерить ни один датчик: звезда медленно, неумолимо нагревалась. Не вспыхивая, не пульсируя — просто рост, как температура у человека с хронической лихорадкой.

— Светимость звезды превысила критический порог, — произнёс Кайрос ровным, ничем не взволнованным голосом. — Рекомендую эвакуацию девяностого сектора.

Лира не ответила. Девять лет эта звезда была просто фонарём — фонарём, за которым она жила, работала, спала. А теперь она лихорадила.

— Светимость выросла на десять процентов за миллион лет, — сказала она себе под нос. — Не пульсация это. Лихорадка.

Прошло пол-секунды — и ИИ ответил:

— У звёзд нет инфекций.

— Не знают, — поправила Лира. — Могут гореть так ярко, что сами себя сжечь могут. Просто медленнее, чем люди.
Показать
Вишь, в конце тоже некоторым образом коряво. А начиналось вообще с жуткой жути... Но агент-космофизик весьма неплохо провел фактчекинг и превратил сказку в приличную научную фантастику.
12. dsdred 4276 04.08.26 11:56 Сейчас в теме
(9) Ясно. Рассказы потом визуализировать в планах?
13. starik-2005 3301 04.08.26 13:18 Сейчас в теме
(12)
визуализировать
Пока тестирую гипотезы в части языка, ибо любой настоящий программист - это специалист по языкам, хоть и специально созданным для программирования. Поэтому все те заунывные статьи про афазии и прочие языковые расстройства языковых моделей - штука полезная, хоть и неверная на мой взгляд в своей сути. Но любая дичь может натолкнуть на приличные мысли.

ЗЫ: для того, чтобы приличный мульт собрать, у меня комп не тот, а т.к. я пока условно безработный, то и не планирую.
16. dsdred 4276 04.08.26 17:28 Сейчас в теме
(13) На каком железе крутите модельки?
19. starik-2005 3301 04.08.26 21:10 Сейчас в теме
(16)
железе
Как раз 2х5070ti. 150к за обе + мать и корпус за еще 50 + память, которая у меня уже была - 96 Гб, накопители и прочее барахло тоже было.
20. dsdred 4276 04.08.26 21:26 Сейчас в теме
(19) хорошая машинка
23. starik-2005 3301 05.08.26 09:11 Сейчас в теме
(20) вчера смог толком без докеров завести свежий vLLM - 176 т/с на поток, до 700+ токенов на 8 потоках. Но да - контекст маловат для 8 агентов внутри опенкода, но для множества запросов от собственных агентов вполне хватвет.

Модель Ornith1-0 35b - доученый qwen 3.5, который по тестам совсем хорош. GPTQ INT4
25. dsdred 4276 05.08.26 10:04 Сейчас в теме
(23) Я пока vLLM, на сколько понимаю он хорош для параллельной работы команды, у меня пока llama.cpp справляется, но vLLM рано или поздно воткну.
176 т/с на поток - это просто отличный результат
26. starik-2005 3301 05.08.26 10:26 Сейчас в теме
(25) да, начинать лучше с llama.cpp - для винды тем более собрано уже все, но она юзает только ядра CUDA, vLLM и еще типа более крутой SGLang - они юзают тензорные и прочие ядра, т.е. на условно 100% выгребают мощности и способности blackwell точно. В итоге 176-177 т/с 1 поток, дальше деградация идет, но запаса мощности карты хватает и на 8 потоках до 700 т/с доходит, т.е. на 1 поток чуть менее 100 т/с. Крайне рекомендую разобраться с тем, как это все поставить без докера - ИИ тут помогает с трудом.

ЗЫ: в llama 155 т/с на этой модели, но в q6. Температура карт в llama -> 75°, в vLLM - не выше 60° - за счет более оптимизированных механизмов.
27. dsdred 4276 05.08.26 12:30 Сейчас в теме
(26) да я хочу в ближайшем будущем на vLLM перейти.

Для дома и llama.cpp норм, но на работе люди начали юзать локальную инсталяцию и при одновременном использовании уже есть проседания.
28. starik-2005 3301 05.08.26 12:33 Сейчас в теме
(27) если сможешь поставить SGLang - ставь его. Но собрать ядра тритона и прочие будет нифига не просто. У меня не получилось пока - недостаточно мотивации. Но на vLLM в полном фарше меня хватило.
30. dsdred 4276 05.08.26 12:47 Сейчас в теме
(28) хорошо. Буду пробовать
34. starik-2005 3301 05.08.26 21:52 Сейчас в теме
(30) Добавил одну переменную окружения и, опа, 184 т/с вместо 177.
Прикрепленные файлы:
35. dsdred 4276 05.08.26 21:53 Сейчас в теме
36. starik-2005 3301 05.08.26 22:07 Сейчас в теме
(35)
Магия
Особо магично то, что я на 300W без удушения карт запускал, т.к. забыл про то, что я их душу (чтобы не температурили, ибо в лламе как раз грелись до 80 при 300W), и не душил, а температура 50-60 в пределе при таких скоростях.
================================================================================
  CHAT | workers=1 | stream=True
============================================================­====================
  [ 0] ptok=    0 ctok= 1024 | decode=  5.87s | avg= 174.4 tok/s | TTFT=0.261s | iTok=0.0055s
  [ 1] ptok=    0 ctok= 1024 | decode=  5.57s | avg= 183.8 tok/s | TTFT=0.046s | iTok=0.0054s
  [ 2] ptok=    0 ctok= 1024 | decode=  5.55s | avg= 184.5 tok/s | TTFT=0.046s | iTok=0.0054s
  [ 3] ptok=    0 ctok= 1024 | decode=  5.57s | avg= 183.9 tok/s | TTFT=0.044s | iTok=0.0054s
  [ 4] ptok=    0 ctok= 1024 | decode=  5.61s | avg= 182.6 tok/s | TTFT=0.045s | iTok=0.0054s
  [ 5] ptok=    0 ctok= 1024 | decode=  5.61s | avg= 182.6 tok/s | TTFT=0.045s | iTok=0.0054s
  [ 6] ptok=    0 ctok= 1024 | decode=  5.61s | avg= 182.7 tok/s | TTFT=0.045s | iTok=0.0054s
  [ 7] ptok=    0 ctok= 1024 | decode=  5.61s | avg= 182.7 tok/s | TTFT=0.046s | iTok=0.0054s
  [ 8] ptok=    0 ctok= 1024 | decode=  5.61s | avg= 182.7 tok/s | TTFT=0.045s | iTok=0.0054s
  [ 9] ptok=    0 ctok= 1024 | decode=  5.61s | avg= 182.4 tok/s | TTFT=0.046s | iTok=0.0054s
  [10] ptok=    0 ctok= 1021 | decode=  5.61s | avg= 182.1 tok/s | TTFT=0.049s | iTok=0.0054s
  [11] ptok=    0 ctok= 1024 | decode=  5.60s | avg= 182.7 tok/s | TTFT=0.044s | iTok=0.0054s
  [12] ptok=    0 ctok= 1024 | decode=  5.60s | avg= 183.0 tok/s | TTFT=0.045s | iTok=0.0054s
  [13] ptok=    0 ctok= 1024 | decode=  5.59s | avg= 183.1 tok/s | TTFT=0.048s | iTok=0.0054s
  [14] ptok=    0 ctok= 1021 | decode=  5.59s | avg= 182.5 tok/s | TTFT=0.045s | iTok=0.0054s
  [15] ptok=    0 ctok= 1024 | decode=  5.57s | avg= 183.9 tok/s | TTFT=0.044s | iTok=0.0054s
  [16] ptok=    0 ctok= 1024 | decode=  5.57s | avg= 183.8 tok/s | TTFT=0.048s | iTok=0.0054s
  [17] ptok=    0 ctok= 1022 | decode=  5.59s | avg= 182.8 tok/s | TTFT=0.044s | iTok=0.0054s
  [18] ptok=    0 ctok= 1024 | decode=  5.62s | avg= 182.3 tok/s | TTFT=0.044s | iTok=0.0054s
  [19] ptok=    0 ctok= 1024 | decode=  5.59s | avg= 183.1 tok/s | TTFT=0.046s | iTok=0.0054s
============================================================­====================
  Prompts: 20 | OK: 20 | Fail: 0
  Total tokens generated: 20472
  Total decode time: 112.1s
  Overall speed: 182.6 tokens/sec
  TTFT: avg=0.056s  min=0.044s  max=0.261s
  Inter-token: avg=0.0054s  min=0.0054s  max=0.0055s
Показать
37. dsdred 4276 05.08.26 22:09 Сейчас в теме
(36) А, понятно. Возьму на заметку.
14. ildarovich 8065 04.08.26 16:38 Сейчас в теме
Вот в этой статье Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле аргументировано утверждается, что облако сейчас выгоднее своего железа.
top_1c; Yashazz; dsdred; Andrey_Timofeev; +4 Ответить
15. dsdred 4276 04.08.26 17:23 Сейчас в теме
(14)
Статья написана подробно, и многие неценовые факторы - безопасность данных, зависимость от провайдера, ограничения контекста, качество моделей и обслуживание оборудования - в ней действительно рассмотрены.

Но приведенные расчеты не полностью описывают мой сценарий. Я использую две RTX 5060 ti, а вся сборка обошлась примерно в 350 тысяч рублей - дешевле указанной в статье стоимости одной карточки RTX 5090. Компьютер включается только тогда, когда нужен, поэтому электричество во время простоя почти не расходуется. Кроме того, обслуживание выполняю самостоятельно, и отдельную стоимость инженера в расчет добавлять не требуется.

Поэтому я бы не делал универсальный вывод, что API всегда дешевле собственного оборудования. Для нерегулярной интерактивной нагрузки и дешевого API вывод статьи выглядит убедительно. Но при регулярной пакетной работе, более дешевой сборке, высокой загрузке и требованиях к локальности данных экономика может оказаться другой.

Чтобы сравнение было окончательным, нужно пересчитать его для двух RTX 5060 ti или RTX 5070 ti, используя реальный объем токенов и цену API той же самой модели.

Лично я этим заниматься не готов ))
Да и, в своей статье я в итоге пришел к гибридному подходу.

На мой взгляд, именно он в большинстве случаев оказывается наиболее практичным: локальные модели - там, где это действительно выгодно или необходимо, а API - там, где он дает преимущество.
Andrey_Timofeev; +1 Ответить
17. Andrey_Timofeev 14 04.08.26 19:01 Сейчас в теме
(15) Месяцев 9 назад (когда цены еще были в разы ниже) прикупил новый ПК со встроенной видюхой, 64ГБ оперативки. Теоретически 32 ГБ может быть отдано под видеокарту. Пока руки не дошли попробовать в деле - более менее неплохо с моими проектами справляются онлайн чаты ИИ, Как считаете, нормально будет ИИ работать на таком железе?
18. dsdred 4276 04.08.26 21:02 Сейчас в теме
(17) я в феврале брал за 350к ПК, сейчас такой стои 400+К и прогнозы; что будет дороже.

Я же незнаю, что за встроенная видео и процессор. Могу лишь сказать что на видяхах с поддержкой Cuda самый шучтрый вариант.
22. Andrey_Timofeev 14 05.08.26 00:39 Сейчас в теме
(18) Процессор AMD Ryzen 5 8600G .
24. dsdred 4276 05.08.26 10:01 Сейчас в теме
(22) Для знакомства с локальными LLM - вполне. У вас проблема в том, что видеокарты нет нормальной. Оперативки можно выделить хоть 32 ГБ, но это не превратит ее в видеокарту с 32 ГБ VRAM. DDR5 в несколько раз медленнее памяти GDDR6/GDDR7.

Поэтому небольшие модельки будут работать вполне комфортно, но серьезные не очень быстро.
roman72; Andrey_Timofeev; +2 Ответить
29. Andrey_Timofeev 14 05.08.26 12:42 Сейчас в теме
(24) Сам ожидаю, что будет медленнее раза в 3-4, чем на современной видеокарте. Что может быть вполне комфортно. В общем, понял, что надо пробовать.)) Хочу попробовать что нибудь из моделей от QWEN, которые рассчитаны именно на 32 ГБ
31. dsdred 4276 05.08.26 12:49 Сейчас в теме
(29) у меня qwen3.6 35B и 27B на 32 нормально влезают.
На следующей неделе должны выложить 3.8
Andrey_Timofeev; +1 Ответить
32. Andrey_Timofeev 14 05.08.26 12:56 Сейчас в теме
(31) Сам жду. Она весьма неплохо программирует в 1С. Но, боюсь, нормальный результат не будет достигнут в рамках 3.8 для 32ГБ оперативки. Все же руки чешутся попробовать.
33. dsdred 4276 05.08.26 13:16 Сейчас в теме
(32) я ее тоже жду. Мы сейчас на работе 3.6 используем.
У 3.6 контекст 250к а у 3.8 аж 1КК
Andrey_Timofeev; +1 Ответить
21. starik-2005 3301 04.08.26 21:34 Сейчас в теме
(14) Хорошая статья про "за все надо платить", лучше побольше. 2 карточки уровня 9060XT с 16 гигами дадут условно 80 т/с на qwen 3.6 35B q6, если дело в скорости, и стоят всего 80к, если дело в цене. По опыту знаю, что купленная подписка не всегда такое умеет. По качеству, то если качество - это разнообразные бенчи, то купленные модели лучше, но не прям вот космос-космос. У них те же глюки, путаница токенов, подмена слов. Циклы ревью этот вопрос решают в обоих случаях. LongGraph и прочие писанные штуки (можно даже на qwen указанной такое написать с помощью промптов и питона) позволяют это все "устаканить".
dsdred; Andrey_Timofeev; +2 Ответить
49. top_1c 4173 22.08.26 09:02 Сейчас в теме
(14) Сейчас облачные ИИ очень очень дешевые, согласен. Но для задач, которые не нужно, чтобы вытекали в сеть, можно обзавестись личным железом, тут как бы без этого никуда.
38. Yashazz 4933 06.08.26 10:23 Сейчас в теме
Вот картинки бы эти дурацкие поубирать бы, и выйдет, возможно, неплохая статья. А так - читать невозможно. Есть всё-таки разница между демонстрацией, презентационным набором слайдов, и нормальной публикацией.
40. dsdred 4276 06.08.26 10:37 Сейчас в теме
(38) Экспериментальная статья. Пробую разные стили.
Опять же тут не угадаешь. Кому то понравилось, кому то нет.
Для отправки сообщения требуется регистрация/авторизация