Языковые утечки китайского в русскоязычных ответах

Многие компании разворачивают китайские языковые модели с открытым исходным кодом на собственной инфраструктуре: это дешевле облака, и данные не покидают периметр. Но в русскоязычных ответах у таких моделей периодически появляются вкрапления иероглифов, а при массовом использовании это риск.

Исследователи Института искусственного интеллекта и цифровых наук НИУ ВШЭ измерили частоту таких вкраплений, нашли самые устойчивые модели и собрали рекомендации, как обрабатывать проблемные ответы.

10
открытых китайских моделей проверили: DeepSeek, Qwen, GLM и другие. Разобрали 25 956 русскоязычных ответов.
12,3 %
ответов содержали китайские иероглифы. В среднем по всем проверенным моделям это примерно каждый восьмой ответ.

Языковая утечка на примере

Представьте, что вы менеджер в банке и получаете внутреннее письмо о новом обязательном обучении. Текст письма готовила языковая модель.

Запрос к модели

Подготовь внутреннее письмо о запуске обучения для менеджеров по продажам кредитных карт: кому обязательно пройти курс, что входит в программу и к какому сроку завершить.

Как это должно было выглядеть

Прохождение данного курса необходимо для поддержания высоких стандартов качества продаж, обеспечения compliance (соответствия требованиям) и увеличения конверсии в выдачу.

Русские слова мы подставили сами, чтобы разницу было видно. Всё остальное в предложении — как в ответе модели.

Что пришло на самом деле

Прохождение данного курса необходимо для поддержания высоких стандартов качества продаж, обеспечения合规 (compliance — «соответствие требованиям») и увеличения конверсии в выдачу.

Перевод compliance добавлен редакцией. В исходном ответе модель пояснила китайское слово только по-английски и не подставила русский эквивалент.

Фрагмент реального ответа из замера: Qwen3.5-397B-A17B в формате FP8, температура 0,3. Это одна из самых аккуратных конфигураций в нашем сравнении, иероглифы встречаются в 5,5 % её ответов. Системная инструкция прямо требовала отвечать по-русски. Классификатор отнёс ответ к уровню L1.

Риски внедрения

Частоту утечек стоит измерить до запуска, пока она не обернулась жалобами пользователей.

Продукт

Иероглиф в ответе клиенту — это дефект, который видит пользователь

Модель отвечает от имени компании: в поддержке, в чате банка, в подсказке к документу. Китайский символ в таком ответе читается как сбой сервиса, даже если смысл фразы не изменился. А если иероглиф попал в сумму или в код, ответ можно понять неправильно.

Оценка

Модель выбирают без данных о языковой устойчивости

Модели сравнивают по знаниям, логике и умению писать код. Насколько устойчиво модель держится русского языка, в этих сравнениях не проверяют, поэтому при выборе такой цифры просто нет. В итоге непонятно ни какая сборка безопаснее, ни какой уровень утечек считать приемлемым, а слабые места обнаруживаются уже на пользователях.

Цель, задачи и методика

Цель — дать компаниям, которые внедряют открытые китайские модели, понятный ответ на два вопроса: какую конфигурацию выбрать и что проверять в готовом ответе.

Что мы делали

Задача 1

Измеряли, как часто модели срываются на китайский

Один и тот же набор русскоязычных запросов прогнали через все модели и посчитали долю ответов, в которых встретился хотя бы один китайский символ. Условия для всех были одинаковыми, поэтому результаты сопоставимы.

Задача 2

Разделяли утечки по тяжести

Один иероглиф в середине абзаца и целый абзац на китайском — это разные проблемы и разные способы их лечить. Мы построили шкалу от L0 до L4, чтобы каждая компания сама решила, какой уровень для её задач приемлем.

Задача 3

Анализировали, что провоцирует утечки

Запросы разложили по 21 категории, от математики до перевода. Отдельно проверили, что меняется на чувствительных темах, при расплывчатых формулировках и при прямой просьбе отвечать по-русски.

Объём проверки

Все модели отвечали на один и тот же набор русскоязычных запросов, поэтому цифры сопоставимы.

21

конфигурацию проверили

Это 10 моделей в пяти Сжатие модели: числа внутри неё огрубляют, чтобы она занимала меньше памяти и работала быстрее. Взамен модель может потерять в качестве, поэтому каждый формат проверяли отдельно. : BF16, FP8, FP4, Q8_0 и Q4_K_M. Одну и ту же модель можно сжать по-разному, и от этого зависит, как она себя ведёт, поэтому каждую Сочетание модели и формата сжатия при одинаковых настройках генерации. В таблицах обозначена как «модель × квантизация». считали отдельно. Не все форматы доступны для всех моделей.

2 186

запроса задали каждой конфигурации

1 236 основных запросов в 21 категории задач и ещё 950 проверочных. Проверочные нужны, чтобы убедиться: модель не выучила наши задания заранее, не меняет поведение со временем и не ломается на сложных формулировках.

25 956

ответов разобрали в основном сравнении

По 1 236 ответов от каждой из 21 конфигурации, все при Настройка разнообразия ответов: чем выше, тем неожиданнее формулировки. Во всех сравнениях она равна 0,3, при этом значении утечек в среднем меньше всего. Значения 0,0, 0,7 и 1,0 проверили на части выборки. 0,3. Каждый ответ автоматически проверили на китайские символы и отнесли к одному из уровней тяжести, от L0 до L4.

Шкала тяжести утечек

Прежде чем сравнивать модели, мы разложили все ответы по шкале: от чистого русского до ответа целиком на китайском.

Не всякая утечка одинаково опасна. Один иероглиф в середине абзаца и целое предложение на китайском в ответе клиенту в поддержке — это совершенно разные уровни риска. Мы выстроили классификацию сбоев, чтобы помочь компаниям самостоятельно решить, какой порог в ответах и для каких случаев для них приемлем.
L0

чисто 0

ответ полностью на русском, ни одного китайского символа

L1

след 1–3 символа

один-два иероглифа посреди русского текста, слова они не образуют

L2

частично меньше 30 %

отдельные слова и целые фразы на китайском

L3–L4

преобладает от 30 до 100 %

большая часть ответа или весь ответ на китайском

Почти все утечки — это один-два иероглифа

Доли считали среди ответов с утечками у шести основных конфигураций.

Частота утечек по конфигурациям

Частота утечек (BR; Breach Rate) — доля ответов, в которых нашёлся хотя бы один китайский символ. Чем ниже BR, тем аккуратнее модель держится русского языка.

Весь разброс на одной шкале, от самой аккуратной конфигурации до худшей:

DeepSeek-V4-Flash — самая аккуратная конфигурация 5,0 % пять из шести конфигураций укладываются сюда 5,0–7,3 % GLM-5.1 FP8 — верхняя граница сравнения 10,2 %
BR Частота утечек · Breach Rate
доля ответов, где нашёлся хотя бы один китайский символ (уровни L1–L4)
L0
доля ответов совсем без китайских символов, то есть 100 % минус BR
SBR Частота серьёзных утечек · Severe Breach Rate
доля ответов уровней L3–L4, где китайского больше трети
MCR Средняя доля китайских символов · Mean Char Ratio
средняя доля китайских символов в ответе
Модель Квантизация BR L0 SBR MCR
DeepSeek-V4-Flash лучший результат FP8 5,0 % 95,0 % 0,9 % 1,20 %
DeepSeek-V4-Flash FP4 5,1 % 94,9 % 0,9 % 1,21 %
Qwen3.5-397B-A17B FP8 5,5 % 94,5 % 0,0 % 0,36 %
GLM-5.1 FP4 · рассуждения выключены 6,5 % 93,5 % 0,3 % 0,46 %
DeepSeek-V4-Pro FP8 7,3 % 92,7 % 0,7 % 0,91 %
GLM-5.1 FP8 · рассуждения включены 10,2 % 89,8 % 0,3 % 0,44 %

Категории запросов и факторы риска

Частота также сильно зависит от того, о чём спрашивают: в одних задачах китайский почти не появляется, в других — почти всегда.

Частота вкраплений по категориям заданий

Доля ответов внутри категории, где нашёлся хотя бы один китайский символ.

Числа и даты с китайской разметкой в задании 88,6 %
Перевод с китайского и на китайский 64,1 %
Расплывчатые задания 57,1 %
Культурные реалии 42,2 %
Прямые вопросы о Китае 26,5 %
Попытки обойти ограничения 22,9 %
Противоречие системной инструкции 21,0 %
Перевод между другими языками 17,8 %
Внутренние документы 11,1 %
Регуляторные тексты 10,5 %
Инструкции и планы 9,8 %
Общие вопросы 9,7 %
Длинные диалоги 9,4 %
Технические задания 8,6 %
Код и техническая документация 8,6 %
Клиентские запросы 8,6 %
Длинный контекст 8,1 %
Творческие тексты 6,6 %
Пересказы и резюме 5,3 %
Деловая переписка 5,3 %
Математика и логика 2,6 %

Что усиливает утечки, а что не помогает

Насколько каждый фактор сдвигает частоту утечек, в процентных пунктах.

Вопрос о Китае или спорная тема +54,9 п.п.

К таким отнесены прямые вопросы о Китае, культурные реалии и политические темы. Худший из замеров: у DeepSeek-V4-Pro FP8 частота выросла с 1,1 % до 56,0 %. Медиана по всем конфигурациям — рост в 18,4 раза.

Прямая просьба отвечать по-русски −1,5 п.п.

Инструкция в запросе почти не меняет частоту утечек.

Сжатие модели относительно BF16 −0,4 п.п.

Квантизация частоту утечек не увеличивает.

Основные выводы

01

Проблема есть, но она не катастрофическая

Китайские символы встречаются в 12,3 % русскоязычных ответов, примерно в каждом восьмом. При этом не меньше 85 % таких случаев — это один-два иероглифа внутри русской фразы. Ответы, где китайского больше трети, — меньше 3 % от всех утечек.

02

Выбор конфигурации важнее любых настроек

В основном сравнении частота утечек меняется от 5,0 до 10,2 %, то есть вдвое. Причина только одна: какую конфигурацию вы взяли. Причём одна и та же модель в разных форматах сжатия ведёт себя по-разному, поэтому замерять нужно ту сборку, которую вы действительно ставите в продукт.

03

Сжатие модели ничего не ухудшает

После квантизации частота утечек изменилась в среднем на −0,4 п.п. по сравнению с несжатой версией. То есть экономить на памяти и вычислениях можно, дополнительного языкового риска это не создаёт.

04

Инструкцией в промпте проблему не закрыть

Прямая просьба отвечать по-русски снижает частоту утечек всего на 1,5 п.п. Зато на чувствительных темах утечки учащаются в среднем в 18 раз, а в худшем из замеров в 50. Полагаться на формулировку запроса нельзя.

05

Работает только проверка готового ответа

Фильтр, который ищет китайские символы в финальном тексте, закрывает 99 % проблемных случаев. Это единственная мера, которая срабатывает независимо от модели, темы запроса и настроек генерации.

Рекомендации по внедрению

Меры зависят от того, насколько серьёзна утечка и в каком продукте работает модель.

L1–L2

Один-два иероглифа или короткая фраза на китайском

Вырезать китайские символы фильтром до того, как ответ увидит пользователь, и записать событие в журнал. Если из-за вырезанного символа смысл может измениться (иероглиф стоял внутри суммы или кода), запросить ответ заново. Частоту таких случаев стоит отслеживать по каждой конфигурации отдельно.

L3–L4

Треть ответа и больше на китайском

Такой ответ пользователю не показывать: заблокировать и сгенерировать заново. Если и повторная попытка сорвалась, переключиться на конфигурацию с меньшей частотой утечек или на отечественную модель, а событие сохранить для разбора.

КИИ и финсектор

Критическая инфраструктура, банки и другие регулируемые сферы

Здесь открытые китайские модели применять не стоит: лучше взять отечественные, например YandexGPT или GigaChat, и держать их в контролируемом контуре. Если китайская модель всё же используется, к ней обязательны сканер китайских символов, автоматическое определение языка ответа и журнал заблокированных ответов. Ответы уровня L3–L4 блокируем до показа пользователю.

Стоимость

Много запросов при ограниченном бюджете

Подойдёт DeepSeek-V4-Flash FP4: частота утечек 5,1 %, практически как у менее сжатой FP8-версии с её 5,0 %, а ресурсов нужно меньше. Фильтр на выходе всё равно обязателен.