ИИ-инструменты для 1С на исполняемом бенчмарке: 35 задач, реальная платформа, разбор ошибок

21.09.26

Интеграция - Нейросети

Открытый бенчмарк PRISM не оценивает код глазами, а компилирует и исполняет его: 15 алгоритмических задач в OneScript и 20 платформенных против синтетической базы в реальной 1С, 171 скрытый тест, оси синтаксис / семантика / оптимальность / платформа. В лидерборде 52 модели, но ассистентов, живущих внутри IDE, там нет в принципе. Мы подключили к той же методике 1С:Напарник (через его агентный режим), GigaChat 3.5 Ultra и новую GigaChat 3 Pro, а модели Яндекса взяли из готовой таблицы. Результат: Напарник решил 31 задачу из 35 и на платформенных задачах обошёл Claude Opus 5, GLM 5.3 и Kimi K3; GigaChat 3.5 Ultra — 19 из 35; Alice AI LLM Flash — 16; GigaChat 3 Pro — 3. В статье: как подключить агента без API, разбор четырёх дефектов (выдуманный метод массива, «ё» в системном перечислении, таблица значений в запросе без типизации), перекос самой методики и стоимость замера.

Зачем понадобился замер

Про ИИ-помощников для 1С сегодня говорят в двух жанрах: пресс-релиз («ускоряет разработку на 60 %») и личное впечатление («попробовал — понравилось / ерунда»). Оба жанра нельзя проверить. Разработчику и руководителю нужен третий: исполняемый тест, где код не оценивают глазами, а компилируют и прогоняют против базы.

Такой тест для 1С существует — открытый бенчмарк PRISM (MIT, репозиторий genlab-1c/prism, витрина prism.genlab-1c.ru). Мы взяли его методику, подключили к ней инструменты, которых в их таблице нет, и получили цифры, которые можно проверить и повторить.

Коротко главный результат: специализированный ассистент 1С решил 31 задачу из 35 и вошёл бы в первую десятку мирового лидерборда, обогнав Claude Opus 5, GLM 5.3 и Kimi K3 на платформенных задачах. Универсальные российские модели отстают от него вдвое. Ниже — как это измерялось, где инструменты ошибаются и почему одна «ошибка» ошибкой не является.

Что такое PRISM

Бенчмарк состоит из 35 задач двух категорий:

  • Категория A — 15 алгоритмических задач: коллекции, строки, числа, даты. Чистый встроенный язык, без метаданных. Исполняется в OneScript, синтаксис проверяется BSL Language Server.
  • Категория B — 20 платформенных задач: запросы, регистры накопления и сведений, срезы последних, иерархия, табличные части, бухгалтерские итоги. Под каждую задачу собирается своя синтетическая конфигурация, и решение исполняется в реальной 1С:Предприятие против этой базы.

Всего 171 скрытый тест. Решение проходит четыре оси, которые авторы называют SMOP:

Ось Что меряет
S — синтаксис компилируется ли код, кластеры ошибок разбора
M — семантика доля пройденных скрытых тестов
O — оптимальность замер под нагрузкой на растущих входах: запрос в цикле, агрегация в коде вместо запроса
P — платформа обращения к объектам метаданных: выдуманные объекты штрафуются

Баллы сводятся в итоговый Q (0–10). Рядом показывают «решено» — долю задач, где пройдены все скрытые тесты. Это самая честная колонка: частично правильный код в производстве не нужен.

В лидерборде на момент замера — 52 модели, от GPT-6 Astra и Claude Opus 5 до GigaChat 2 Lite. Важно понимать, чего там нет: в таблицу попадают только модели, доступные по API. Ассистентов, которые живут внутри IDE и работают агентом, там нет в принципе — категории для них не существует.

Что мы добавили к их таблице

Три инструмента, которых в лидерборде не было:

  1. 1С:Напарник для разработки (сервис code.1c.ai, плагин 1C:Workmate 1.0.7 в 1С:EDT 2025.2) — ассистент фирмы «1С» с агентным режимом.
  2. GigaChat 3.5 Ultra (432B, открытые веса, доступна в облаке) — флагман Сбера.
  3. GigaChat 3 Pro — модель, появившаяся в каталоге в сентябре 2026.

Модели Яндекса добавлять не пришлось: YandexGPT 5 Lite/Pro, YandexGPT 5.1 Pro, Alice AI LLM и Alice AI LLM Flash уже в лидерборде, а новых поколений Яндекс за 2026 год не выпускал.

Как подключается агент, у которого нет API

С моделями всё просто: харнесс сам шлёт промпт и забирает ответ. С Напарником так нельзя — у него нет открытого API, а лицензионное соглашение запрещает обходить клиентскую часть. Поэтому работа шла через сам плагин, и выручила его собственная агентная функция:

  • каждая задача — новый диалог (иначе контекст предыдущих решений копится и замер перестаёт быть чистым: у нас первый прогон случайно прошёл одним диалогом и дал завышенный балл);
  • промпт — ровно тот же текст, что получают модели: системная часть из бенчмарка плюс условие задачи, для категории B к нему добавляется схема синтетической конфигурации;
  • одна служебная строка: «сохрани итоговый код в файл»;
  • агент в режиме исполнения сам пишет файл, а скрипт забирает его с диска — читать экран и парсить чат не нужно;
  • дальше — штатные скореры бенчмарка: категория A в OneScript, категория B на стенде с реальной платформой 8.3.27.

Оговорки о сопоставимости, без которых цифры некорректны: у моделей промпт делится на системную и пользовательскую части, у агента это одно сообщение; в категории B модели собирают метаданные сами через вызовы инструментов, агенту схема дана тем же текстом; ось O на нашем стенде не измеряется, поэтому Q по категории B считается по трём осям; прогон одиночный, без повторов.

Результаты

Инструмент Алгоритмика (A) Платформенные (B) Всего Q_A Q_B
1С:Напарник (агент в EDT) 13/15 18/20 31/35 8.79 9.30
GigaChat 3.5 Ultra 6/15 13/20 19/35 6.53 8.00
Alice AI LLM Flash (из лидерборда) 9/15 7/20 16/35 7.25 6.15
GigaChat 3 Pro 2/15 1/20 3/35 4.30 3.88
YandexGPT 5.1 Pro (из лидерборда) 1/15 2/20 3/35 4.77 3.66
GigaChat 2 Max (из лидерборда) 1/15 2/20 3/35 5.13 3.17

Для масштаба — верх мирового лидерборда: GPT-5.6 Sol 34/35, GPT-6 Astra 33/35, Claude Opus 5, Kimi K3, GLM 5.3 и Gemini 3.8 Flash — по 32/35.

Три наблюдения, которые кажутся важнее самих чисел.

Специализация бьёт размер. Напарник обошёл флагманскую 432-миллиардную модель Сбера почти вдвое (31 против 19) и по платформенным задачам обошёл Opus 5, GLM 5.3 и Kimi K3 — у тех 17 из 20. Обучение на платформе и агентная обвязка дают больше, чем количество параметров.

Платформенные задачи — сильная сторона Напарника, алгоритмика — слабая. 18 из 20 там, где запросы и регистры; 13 из 15 там, где чистые коллекции и строки. По категории A он на 19-м месте таблицы, рядом с GPT-5.6 Terra, — то есть обычный код без платформы ему даётся хуже, чем топовым моделям.

Новая GigaChat 3 Pro для кода 1С непригодна. Три задачи из 35 — ровно как у прошлогодней GigaChat 2 Max. Половина платформенных решений (10 из 20) просто не компилируется. При этом модель в восемь раз дешевле 2-Max и с вдвое большим контекстом — для текстовых задач это хороший выбор, для генерации BSL — нет.

Разбор ошибок: где инструменты спотыкаются

Это самая полезная часть замера — конкретные дефекты, которые стоит держать в голове при ревью ИИ-кода.

Выдуманный метод платформы. Напарник в задаче на вставку в отсортированный массив написал Копия.Сортировать(). Такого метода у типа Массив нет: синтакс-помощник перечисляет ВГраница, Вставить, Добавить, Количество, Найти, Очистить, Получить, Удалить, Установить, а живая платформа 8.3.27 отвечает «Метод объекта не обнаружен (Сортировать)». Классическая галлюцинация правдоподобного API: массивы в 1С штатно не сортируются, их перегружают в таблицу или список значений.

Ошибка на букве «ё». В задаче на сальдо по счёту код обратился к ВидСчёта.Пассивный, а системное перечисление платформы называется ВидСчета — без «ё». Проверка исполнением: ВидСчета.Пассивный возвращает «Пассивный», вариант с «ё» не существует, модуль не компилируется. Дефект, характерный именно для русскоязычной модели, и линтер его поймает, а глаз — не всегда.

Таблица значений в запросе без типизации колонок. Платформа ответила «Тип не может быть выбран в запросе»: таблица помещена в запрос, но типы колонок не заданы. Живучая ошибка, которую ИИ воспроизводит ровно так же, как начинающий разработчик.

У моделей Сбера характер ошибок другой. У GigaChat 3 Pro половина платформенных решений не компилируется вообще. У 3.5 Ultra, наоборот, ни одного несобирающегося модуля и идеальный синтаксис 10.0 из 10 — она проваливается на логике: неверные результаты и исключения при исполнении. Это разные болезни: первая лечится линтером в конвейере, вторая — только тестами.

Где методика наказывает знание платформы

Один провал Напарника оказался не его виной. В задаче на подсчёт слов он применил СтрНайтиВсеПоРегулярномуВыражению — реальный метод современной платформы; мы проверили исполнением: на строке «раз два три» он находит три совпадения. Но категория A у PRISM исполняется в OneScript, а тот этого метода не знает, и решение засчитано как несобирающееся.

Получается перекос: знание свежих методов платформы 8.3.2x в категории A штрафуется. Без этой задачи у Напарника было бы 32 из 35 — ровно как у Claude Opus 5. Авторам бенчмарка об этом стоит сообщить: либо помечать такие задачи, либо исполнять категорию A на платформе, как категорию B.

Сколько стоит такой замер

Прогон одной модели по 35 задачам — 9–14 руб. по тарифам российского облака; генерация занимает около двух минут, оценка — минут двадцать вместе со стендом. Напарник обошёлся в 0 руб.: сервис бесплатен до 1 октября 2026 года, партнёры «1С» получают ключи доступа сами. Отвечал он 10–150 секунд на задачу, все 35 задач — примерно за 40 минут.

То есть воспроизвести такой замер может любой: инструменты открыты, задачи открыты, стоимость — цена чашки кофе.

Что из этого следует на практике

  • Для платформенного кода — запросы, регистры, итоги — специализированный ассистент 1С сейчас объективно сильнее универсальных моделей, включая мировые флагманы.
  • Для алгоритмики и «обычного» кода он уступает топовым моделям: если задача не про платформу, выбор инструмента другой.
  • Универсальные российские модели в 1С-коде пока отстают: лучшая из Сбера — 3.5 Ultra (19 из 35), лучшая из Яндекса — Alice AI LLM Flash (16 из 35), и это при ценах, сопоставимых с зарубежными.
  • Линтер в конвейере обязателен. Половина разобранных дефектов — синтаксис и несуществующие имена; их ловит статический контроль до запуска.
  • Проверять имена платформы инструментом, а не памятью. Оба «красивых» провала — выдуманный метод и «ё» в перечислении — снимаются сверкой со синтакс-помощником.

Что дальше: задачи уровня «Специалист» и «Эксперт»

У PRISM есть естественный потолок. Его 35 задач — это работа крепкого разработчика: написать запрос, посчитать остатки, обойти иерархию. Именно поэтому верх таблицы так плотный: полтора десятка моделей уже решают 30+ задач, и различать их всё сложнее.

Но профессия начинается там, где эти задачи заканчиваются. Аттестации «1С:Специалист» и «1С:Эксперт по технологическим вопросам» проверяют совсем другое:

  • управляемые блокировки и конкурентный доступ — что произойдёт при одновременном проведении;
  • планы обмена и распределённые базы, коллизии и порядок применения изменений;
  • производительность: план запроса, индексы, эскалация блокировок, разбор по техжурналу;
  • сложные механизмы БСП и границы режима совместимости при доработке расширением;
  • проектирование: не «написать функцию», а выбрать схему данных, которая не развалится на объёме.

Проверить ИИ на таких задачах интереснее всего: здесь недостаточно знать синтаксис — нужно понимать, как платформа ведёт себя под нагрузкой и в многопользовательской работе. Это будет следующий материал: набор задач уровня аттестаций, прогон тех же инструментов и разбор не «скомпилировалось ли», а «выдержит ли это продуктив».

Если у вас есть задачи такого класса — реальные, с однозначно проверяемым результатом — присылайте, включим в набор. Чем больше в наборе настоящей практики, тем меньше в нём места для маркетинга.

Оговорка к будущему материалу. Это не сертификация фирмы «1С» и не её оценка. Названия «1С:Специалист» и «1С:Эксперт» используются только как обозначение уровня задач; условия задач из официальных сборников публиковаться не будут — это издания фирмы «1С», защищённые авторским правом. Проверяется инструмент, а не экзамен, и никакой сертификат таким способом не выдаётся.


Замер выполнен 18 сентября 2026 года. Методика и скореры — открытый бенчмарк PRISM (genlab-1c/prism), прогоны и интерпретация — авторские. Все результаты воспроизводимы: задачи, оценщики и тарифы публичны.

Вступайте в нашу телеграмм-группу Инфостарт

LLM ИИ-ассистент 1С:Напарник GigaChat Alice AI PRISM бенчмарк генерация кода BSL OneScript автотесты оценка качества кода

Вы можете заказать платную адаптацию этой статьи под ваши задачи на «Бирже заказов».

  • 0% комиссии — оплата напрямую исполнителю;
  • Исполнители любого масштаба — от отдельных специалистов до команд под проект;
  • Прямой обмен контактами между заказчиком и исполнителем;
  • Безопасная сделка — при необходимости;
  • Рейтинги, кейсы и прозрачная система откликов.

См. также

SALE! %

Банковские операции Обмен с интернет-банком Мастера заполнения Нейросети Разработчик Бухгалтер Пользователь 1С:Предприятие 8 1C:ERP 1С:Бухгалтерия 3.0 1С:ERP Управление предприятием 2 1С:Управление холдингом 1С:ERP. Управление холдингом 1С:Комплексная автоматизация 2.х 1С:Управление нашей фирмой 3.0 1С:Управление торговлей 11 1С:Розница 3.0 Платные (руб)

Корректируйте банковские документы быстро и легко! Создайте правило обработки — и оно автоматически применится при загрузке выписки (отбор по любому реквизиту или регулярному выражению). Решение заполняет расшифровку платежа, комиссию эквайринга, подбирает ведомости на выплату зарплаты, помечает дубли из банка на удаление и многое другое. Доплачивать за алгоритмы не нужно — они включены в решение. Обработка работает при загрузке из файлов клиент-банка и через DirectBank. Новое — искусственный интеллект: модель приводит нестандартные назначения платежа к виду, понятному алгоритмам, а ИИ-ассистент прямо в 1С консультирует по решению и разбирает код правил и алгоритмов. Поддерживаются локальные и облачные OpenAI-совместимые модели — данные могут не покидать ваш контур.

17500 руб.

20.12.2024    19377    98    32    

83

Нейросети Системный администратор Разработчик Аналитик Бухгалтер Пользователь Руководитель проекта 1С 8.3 1С:Документооборот 1С:Бухгалтерия 3.0 1С:Зарплата и Управление Персоналом 3.x Россия Платные (руб)

Задавайте вопросы базе 1С обычными словами: получайте данные, находите ошибки и связанные документы, проверяйте права, работайте с вложениями и контролируемо вносите изменения. Всё это работает в самой программе, а Codex и Claude подключаются по желанию.

15989 руб.

30.07.2026    12530    26    4    

27

Инструментарий разработчика Нейросети Платные (руб)

Первые попытки разработки на 1С с использованием больших языковых моделей (LLM) могут разочаровать. LLMки сильно галлюцинируют, потому что не знают устройства конфигураций 1С, не знают нюансов синтаксиса. Но если дать им подсказки с помощью MCP, то результат получается кардинально лучше. Далее в публикации: MCP для поиска по метаданным 1С, справке синтакс-помощника и проверки синтаксиса.

15250 руб.

25.08.2025    70797    140    41    

149

Распознавание документов и образов Нейросети 1С:Предприятие 8 1С 8.3 1С 8.5 1C:Бухгалтерия 1С:Зарплата и Управление Персоналом 3.x Беларусь Россия Казахстан Армения Платные (руб)

ИИ-сканер документов с REST API для интеграции с 1С и корпоративными системами. Извлекайте данные из счетов, паспортов, дипломов, патентов и трудовых книжек за секунды. Точность человека - скорость машины. Приложение поддерживает восемь типов документов, четырех провайдеров ИИ (имеется возможность использования локальных ИИ), локальный REST API и экспорт в JSON. Важно! модель должна поддерживать функцию Vision (распознавание файлов и картинок). Запускайте используя локальные ИИ, без подписок и ограничений

6100 руб.

24.08.2026    481    2    0    

1

Нейросети 1С:Управление торговлей 11 Бесплатно (free)

Я не считаю покупку специализированных платных инструментов обязательной для разработки с ИИ: нужную обвязку тоже можно создать с агентом. Показываю этот подход на расширении УТ 11 с динамическим списком остатков. Одно задание Codex, 37 минут до проверки, работающая форма. Рассказываю, как устроено окружение, почему первую попытку пришлось переснять и что получилось в повторном прогоне.

17.09.2026    4801    61    Ibrogim    49    

18

Нейросети Разработчик Руководитель проекта 1C:ERP Бесплатно (free)

Служба на Rust, через которую Claude Code, Cursor или другой MCP-клиент вызывает узких ИИ-агентов. Агент — папка с prompt.md и config.toml, модель — строка в конфиге: DeepSeek, Claude Code по подписке, Codex или локальная модель. Агент получает MCP-инструменты, работает в фоне, каждый ход записывается. Внутри — цифры за три месяца: 10 351 вызов, 78 агентов.

17.09.2026    1466    0    Sorm    6    

10

Нейросети Бесплатно (free)

Отладка кода 1С традиционно выглядит примерно одинаково: поставить точку останова, запустить клиент, воспроизвести сценарий, дождаться остановки, посмотреть локальные переменные, пройти несколько строк, раскрыть очередную структуру или коллекцию, вычислить выражение — и повторить все это еще несколько раз. А что, если значительную часть этой рутины поручить AI-агенту?

15.09.2026    3282    andrew.ab    5    

15

Нейросети Разработчик Аналитик Руководитель проекта Бесплатно (free)

Я принёс команде приём, с которым нейронка наконец начала понимать нашу конфигурацию: у меня он работал, у коллег — нет. Дело было не в постановке задач и не в настройках: причина в том, что на их машинах индекс конфигурации считался бы несколько дней. Замер на одном и том же своде из 26 035 записей: три часа на процессоре против трёх с половиной минут на видеокарте. Разбираю, что такое индексация конфигурации и почему она дорогая ровно один раз, почему наша основная серверная машина — 64 ядра, 768 гигабайт памяти — на этой задаче проигрывает домашнему компьютеру, и почему приём одного человека упирается в вопрос, который никто не любит задавать.

09.09.2026    4605    solbol    9    

9
Для отправки сообщения требуется регистрация/авторизация