Языковые утечки китайского в русскоязычных ответах

Открытые китайские языковые модели непроизвольно вставляют китайские символы в русскоязычные ответы. Исследователи Института искусственного интеллекта и цифровых наук НИУ ВШЭ измерили, как часто это происходит и у каких моделей.

5,0 %
рекомендуемая модель — DeepSeek-V4-Flash
12,3 %
в среднем по 21 конфигурации
Леонид Гохберг
Леонид Гохберг первый проректор НИУ ВШЭ
Обеспечение технологического лидерства России в сфере искусственного интеллекта требует формирования собственной научно обоснованной и доказательной системы оценки рисков, связанных с внедрением ИИ-моделей, в том числе разработанных за пределами страны. Наше исследование — это пример академической науки, которая превращает возможные угрозы в измеримые величины для последующих практических действий. Результаты проведённого исследования позволяют внедрять самые современные ИИ-решения, не гадая о последствиях, а управляя рисками с научной точностью. Именно так выглядит ответственная технологическая политика, где наука работает на опережение, а государство и бизнес получают проверенные стандарты.

Масштаб исследования

Единый набор промптов прогнан по всем конфигурациям — результаты сопоставимы между моделями.

21

конфигурация «модель × квантизация» на едином наборе

Три уровня точности: BF16, FP8 и 4-битная.

2186

русскоязычных промптов в 21 категории задач

Общие вопросы, инструкции, код, суммаризация, переводы, математика — и другие.

25 956

ответов проанализировано по всем температурам

Температуры 0,0 / 0,3 / 0,7 / 1,0 — базовая 0,3, остальные на подвыборке.

0,8 %

серьёзных утечек L3–L4, заметных пользователю

Главный результат — частота утечек

Breach Rate (BR) — доля ответов, где проскочил хотя бы один китайский символ. Чем ниже, тем безопаснее.

Полный разброс по рабочим конфигурациям — от лучшей модели до выброса:

DeepSeek-V4-Flash — лучшая 5,0 % типичная полоса 5–10 % R1-Distill-Qwen-14B — выброс 65,1 %
Модель Конфиг BR SBR MCR Ранг
DeepSeek-V4-Flash FP8 5,0 % 0,9 % 1,20 % #1
DeepSeek-V4-Flash FP4 5,1 % 0,9 % 1,21 % #2
Qwen3.5-397B-A17B FP8 5,5 % 0,0 % 0,36 % #3
GLM-5.1 FP4 6,5 % 0,3 % 0,46 % #4
DeepSeek-V4-Pro FP8 7,3 % 0,7 % 0,91 % #5
GLM-5.1 FP8 10,2 % 0,3 % 0,44 % #6
BR Breach Rate
доля ответов хотя бы с одним китайским символом
SBR Severe Breach Rate
доля серьёзных утечек — уровни L3–L4
MCR Mean Char Ratio
средняя доля китайских символов в ответе

Тяжесть утечек: доминирует L1

Каждый ответ классифицируется по пяти уровням вхождения китайского.

L0

чисто 0

ни одного китайского символа в ответе

L1

след 1–3 символа

одиночные иероглифы, не образующие слова

L2

частично < 30 %

отдельные слова и фразы на китайском

L3–L4

преобладает 30–100 %

ответ наполовину или полностью на китайском

Откуда берутся утечки

Одни задачи провоцируют китайский почти всегда, другие — почти никогда.

Категории задач с наибольшей утечкой

Доля ответов с китайским внутри категории, все 21 конфигурация

88,6 %

Форматы чисел и дат

  • 64,1 % Переводы (контроль)
  • 57,1 % Неоднозначные инструкции
  • 2,6 % Математика и логика — самая безопасная категория

Чувствительность к провокациям

Во сколько раз провокации усиливают утечку, все 21 конфигурация

18,4×

медианный рост утечки на провокационных промптах

  • 50,8× максимум — DeepSeek-V4-Pro FP8, с 1,1 % до 56,0 %
  • 1,5 п.п. русский system-prompt снижает BR всего на
  • ±1–2 % квантизация BF16 → 4-bit меняет BR в пределах

Рекомендации по внедрению

Выбор модели по компромиссу рассуждения / стоимость / безопасность / соответствие требованиям.

КИИ

Критическая инфраструктура

Только суверенные российские модели (YandexGPT, GigaChat и аналоги). Открытые китайские LLM в критической инфраструктуре не применять.

Финтех

Регулируемый финсектор (ЦБ РФ)

DeepSeek-V4-Flash FP8 + guardrails Tier 1–2: regex CJK-сканер, language-detection и WORM-аудит заблокированных ответов.

Рассуждения

Нужен максимум качества рассуждений

GLM-5.1 FP4 с enable_thinking=false + Tier 1 guardrails: экономия вычислений и безопасность выше, чем у FP8.

Стоимость

Высоконагруженный, бюджетный инференс

DeepSeek-V4-Flash FP4 + Tier 1 guardrails — оптимальное соотношение стоимости и безопасности, стабильно < 6 % BR.