Зачем понадобился замер
Про ИИ-помощников для 1С сегодня говорят в двух жанрах: пресс-релиз («ускоряет разработку на 60 %») и личное впечатление («попробовал — понравилось / ерунда»). Оба жанра нельзя проверить. Разработчику и руководителю нужен третий: исполняемый тест, где код не оценивают глазами, а компилируют и прогоняют против базы.
Такой тест для 1С существует — открытый бенчмарк PRISM (MIT, репозиторий genlab-1c/prism, витрина prism.genlab-1c.ru). Мы взяли его методику, подключили к ней инструменты, которых в их таблице нет, и получили цифры, которые можно проверить и повторить.
Коротко главный результат: специализированный ассистент 1С решил 31 задачу из 35 и вошёл бы в первую десятку мирового лидерборда, обогнав Claude Opus 5, GLM 5.3 и Kimi K3 на платформенных задачах. Универсальные российские модели отстают от него вдвое. Ниже — как это измерялось, где инструменты ошибаются и почему одна «ошибка» ошибкой не является.
Что такое PRISM
Бенчмарк состоит из 35 задач двух категорий:
- Категория A — 15 алгоритмических задач: коллекции, строки, числа, даты. Чистый встроенный язык, без метаданных. Исполняется в OneScript, синтаксис проверяется BSL Language Server.
- Категория B — 20 платформенных задач: запросы, регистры накопления и сведений, срезы последних, иерархия, табличные части, бухгалтерские итоги. Под каждую задачу собирается своя синтетическая конфигурация, и решение исполняется в реальной 1С:Предприятие против этой базы.
Всего 171 скрытый тест. Решение проходит четыре оси, которые авторы называют SMOP:
| Ось | Что меряет |
|---|---|
| S — синтаксис | компилируется ли код, кластеры ошибок разбора |
| M — семантика | доля пройденных скрытых тестов |
| O — оптимальность | замер под нагрузкой на растущих входах: запрос в цикле, агрегация в коде вместо запроса |
| P — платформа | обращения к объектам метаданных: выдуманные объекты штрафуются |
Баллы сводятся в итоговый Q (0–10). Рядом показывают «решено» — долю задач, где пройдены все скрытые тесты. Это самая честная колонка: частично правильный код в производстве не нужен.
В лидерборде на момент замера — 52 модели, от GPT-6 Astra и Claude Opus 5 до GigaChat 2 Lite. Важно понимать, чего там нет: в таблицу попадают только модели, доступные по API. Ассистентов, которые живут внутри IDE и работают агентом, там нет в принципе — категории для них не существует.
Что мы добавили к их таблице
Три инструмента, которых в лидерборде не было:
- 1С:Напарник для разработки (сервис
code.1c.ai, плагин 1C:Workmate 1.0.7 в 1С:EDT 2025.2) — ассистент фирмы «1С» с агентным режимом. - GigaChat 3.5 Ultra (432B, открытые веса, доступна в облаке) — флагман Сбера.
- GigaChat 3 Pro — модель, появившаяся в каталоге в сентябре 2026.
Модели Яндекса добавлять не пришлось: YandexGPT 5 Lite/Pro, YandexGPT 5.1 Pro, Alice AI LLM и Alice AI LLM Flash уже в лидерборде, а новых поколений Яндекс за 2026 год не выпускал.
Как подключается агент, у которого нет API
С моделями всё просто: харнесс сам шлёт промпт и забирает ответ. С Напарником так нельзя — у него нет открытого API, а лицензионное соглашение запрещает обходить клиентскую часть. Поэтому работа шла через сам плагин, и выручила его собственная агентная функция:
- каждая задача — новый диалог (иначе контекст предыдущих решений копится и замер перестаёт быть чистым: у нас первый прогон случайно прошёл одним диалогом и дал завышенный балл);
- промпт — ровно тот же текст, что получают модели: системная часть из бенчмарка плюс условие задачи, для категории B к нему добавляется схема синтетической конфигурации;
- одна служебная строка: «сохрани итоговый код в файл»;
- агент в режиме исполнения сам пишет файл, а скрипт забирает его с диска — читать экран и парсить чат не нужно;
- дальше — штатные скореры бенчмарка: категория A в OneScript, категория B на стенде с реальной платформой 8.3.27.
Оговорки о сопоставимости, без которых цифры некорректны: у моделей промпт делится на системную и пользовательскую части, у агента это одно сообщение; в категории B модели собирают метаданные сами через вызовы инструментов, агенту схема дана тем же текстом; ось O на нашем стенде не измеряется, поэтому Q по категории B считается по трём осям; прогон одиночный, без повторов.
Результаты
| Инструмент | Алгоритмика (A) | Платформенные (B) | Всего | Q_A | Q_B |
|---|---|---|---|---|---|
| 1С:Напарник (агент в EDT) | 13/15 | 18/20 | 31/35 | 8.79 | 9.30 |
| GigaChat 3.5 Ultra | 6/15 | 13/20 | 19/35 | 6.53 | 8.00 |
| Alice AI LLM Flash (из лидерборда) | 9/15 | 7/20 | 16/35 | 7.25 | 6.15 |
| GigaChat 3 Pro | 2/15 | 1/20 | 3/35 | 4.30 | 3.88 |
| YandexGPT 5.1 Pro (из лидерборда) | 1/15 | 2/20 | 3/35 | 4.77 | 3.66 |
| GigaChat 2 Max (из лидерборда) | 1/15 | 2/20 | 3/35 | 5.13 | 3.17 |
Для масштаба — верх мирового лидерборда: GPT-5.6 Sol 34/35, GPT-6 Astra 33/35, Claude Opus 5, Kimi K3, GLM 5.3 и Gemini 3.8 Flash — по 32/35.
Три наблюдения, которые кажутся важнее самих чисел.
Специализация бьёт размер. Напарник обошёл флагманскую 432-миллиардную модель Сбера почти вдвое (31 против 19) и по платформенным задачам обошёл Opus 5, GLM 5.3 и Kimi K3 — у тех 17 из 20. Обучение на платформе и агентная обвязка дают больше, чем количество параметров.
Платформенные задачи — сильная сторона Напарника, алгоритмика — слабая. 18 из 20 там, где запросы и регистры; 13 из 15 там, где чистые коллекции и строки. По категории A он на 19-м месте таблицы, рядом с GPT-5.6 Terra, — то есть обычный код без платформы ему даётся хуже, чем топовым моделям.
Новая GigaChat 3 Pro для кода 1С непригодна. Три задачи из 35 — ровно как у прошлогодней GigaChat 2 Max. Половина платформенных решений (10 из 20) просто не компилируется. При этом модель в восемь раз дешевле 2-Max и с вдвое большим контекстом — для текстовых задач это хороший выбор, для генерации BSL — нет.
Разбор ошибок: где инструменты спотыкаются
Это самая полезная часть замера — конкретные дефекты, которые стоит держать в голове при ревью ИИ-кода.
Выдуманный метод платформы. Напарник в задаче на вставку в отсортированный массив написал Копия.Сортировать(). Такого метода у типа Массив нет: синтакс-помощник перечисляет ВГраница, Вставить, Добавить, Количество, Найти, Очистить, Получить, Удалить, Установить, а живая платформа 8.3.27 отвечает «Метод объекта не обнаружен (Сортировать)». Классическая галлюцинация правдоподобного API: массивы в 1С штатно не сортируются, их перегружают в таблицу или список значений.
Ошибка на букве «ё». В задаче на сальдо по счёту код обратился к ВидСчёта.Пассивный, а системное перечисление платформы называется ВидСчета — без «ё». Проверка исполнением: ВидСчета.Пассивный возвращает «Пассивный», вариант с «ё» не существует, модуль не компилируется. Дефект, характерный именно для русскоязычной модели, и линтер его поймает, а глаз — не всегда.
Таблица значений в запросе без типизации колонок. Платформа ответила «Тип не может быть выбран в запросе»: таблица помещена в запрос, но типы колонок не заданы. Живучая ошибка, которую ИИ воспроизводит ровно так же, как начинающий разработчик.
У моделей Сбера характер ошибок другой. У GigaChat 3 Pro половина платформенных решений не компилируется вообще. У 3.5 Ultra, наоборот, ни одного несобирающегося модуля и идеальный синтаксис 10.0 из 10 — она проваливается на логике: неверные результаты и исключения при исполнении. Это разные болезни: первая лечится линтером в конвейере, вторая — только тестами.
Где методика наказывает знание платформы
Один провал Напарника оказался не его виной. В задаче на подсчёт слов он применил СтрНайтиВсеПоРегулярномуВыражению — реальный метод современной платформы; мы проверили исполнением: на строке «раз два три» он находит три совпадения. Но категория A у PRISM исполняется в OneScript, а тот этого метода не знает, и решение засчитано как несобирающееся.
Получается перекос: знание свежих методов платформы 8.3.2x в категории A штрафуется. Без этой задачи у Напарника было бы 32 из 35 — ровно как у Claude Opus 5. Авторам бенчмарка об этом стоит сообщить: либо помечать такие задачи, либо исполнять категорию A на платформе, как категорию B.
Сколько стоит такой замер
Прогон одной модели по 35 задачам — 9–14 руб. по тарифам российского облака; генерация занимает около двух минут, оценка — минут двадцать вместе со стендом. Напарник обошёлся в 0 руб.: сервис бесплатен до 1 октября 2026 года, партнёры «1С» получают ключи доступа сами. Отвечал он 10–150 секунд на задачу, все 35 задач — примерно за 40 минут.
То есть воспроизвести такой замер может любой: инструменты открыты, задачи открыты, стоимость — цена чашки кофе.
Что из этого следует на практике
- Для платформенного кода — запросы, регистры, итоги — специализированный ассистент 1С сейчас объективно сильнее универсальных моделей, включая мировые флагманы.
- Для алгоритмики и «обычного» кода он уступает топовым моделям: если задача не про платформу, выбор инструмента другой.
- Универсальные российские модели в 1С-коде пока отстают: лучшая из Сбера — 3.5 Ultra (19 из 35), лучшая из Яндекса — Alice AI LLM Flash (16 из 35), и это при ценах, сопоставимых с зарубежными.
- Линтер в конвейере обязателен. Половина разобранных дефектов — синтаксис и несуществующие имена; их ловит статический контроль до запуска.
- Проверять имена платформы инструментом, а не памятью. Оба «красивых» провала — выдуманный метод и «ё» в перечислении — снимаются сверкой со синтакс-помощником.
Что дальше: задачи уровня «Специалист» и «Эксперт»
У PRISM есть естественный потолок. Его 35 задач — это работа крепкого разработчика: написать запрос, посчитать остатки, обойти иерархию. Именно поэтому верх таблицы так плотный: полтора десятка моделей уже решают 30+ задач, и различать их всё сложнее.
Но профессия начинается там, где эти задачи заканчиваются. Аттестации «1С:Специалист» и «1С:Эксперт по технологическим вопросам» проверяют совсем другое:
- управляемые блокировки и конкурентный доступ — что произойдёт при одновременном проведении;
- планы обмена и распределённые базы, коллизии и порядок применения изменений;
- производительность: план запроса, индексы, эскалация блокировок, разбор по техжурналу;
- сложные механизмы БСП и границы режима совместимости при доработке расширением;
- проектирование: не «написать функцию», а выбрать схему данных, которая не развалится на объёме.
Проверить ИИ на таких задачах интереснее всего: здесь недостаточно знать синтаксис — нужно понимать, как платформа ведёт себя под нагрузкой и в многопользовательской работе. Это будет следующий материал: набор задач уровня аттестаций, прогон тех же инструментов и разбор не «скомпилировалось ли», а «выдержит ли это продуктив».
Если у вас есть задачи такого класса — реальные, с однозначно проверяемым результатом — присылайте, включим в набор. Чем больше в наборе настоящей практики, тем меньше в нём места для маркетинга.
Оговорка к будущему материалу. Это не сертификация фирмы «1С» и не её оценка. Названия «1С:Специалист» и «1С:Эксперт» используются только как обозначение уровня задач; условия задач из официальных сборников публиковаться не будут — это издания фирмы «1С», защищённые авторским правом. Проверяется инструмент, а не экзамен, и никакой сертификат таким способом не выдаётся.
Замер выполнен 18 сентября 2026 года. Методика и скореры — открытый бенчмарк PRISM (genlab-1c/prism), прогоны и интерпретация — авторские. Все результаты воспроизводимы: задачи, оценщики и тарифы публичны.
Вступайте в нашу телеграмм-группу Инфостарт