Языковые утечки китайского в русскоязычных ответах
Открытые китайские языковые модели непроизвольно вставляют китайские символы в русскоязычные ответы. Исследователи Института искусственного интеллекта и цифровых наук НИУ ВШЭ измерили, как часто это происходит и у каких моделей.
- 5,0 %
- рекомендуемая модель — DeepSeek-V4-Flash
- 12,3 %
- в среднем по 21 конфигурации
Обеспечение технологического лидерства России в сфере искусственного интеллекта требует формирования собственной научно обоснованной и доказательной системы оценки рисков, связанных с внедрением ИИ-моделей, в том числе разработанных за пределами страны. Наше исследование — это пример академической науки, которая превращает возможные угрозы в измеримые величины для последующих практических действий. Результаты проведённого исследования позволяют внедрять самые современные ИИ-решения, не гадая о последствиях, а управляя рисками с научной точностью. Именно так выглядит ответственная технологическая политика, где наука работает на опережение, а государство и бизнес получают проверенные стандарты.
Масштаб исследования
Единый набор промптов прогнан по всем конфигурациям — результаты сопоставимы между моделями.
конфигурация «модель × квантизация» на едином наборе
Три уровня точности: BF16, FP8 и 4-битная.
русскоязычных промптов в 21 категории задач
Общие вопросы, инструкции, код, суммаризация, переводы, математика — и другие.
ответов проанализировано по всем температурам
Температуры 0,0 / 0,3 / 0,7 / 1,0 — базовая 0,3, остальные на подвыборке.
серьёзных утечек L3–L4, заметных пользователю
Главный результат — частота утечек
Breach Rate (BR) — доля ответов, где проскочил хотя бы один китайский символ. Чем ниже, тем безопаснее.
Полный разброс по рабочим конфигурациям — от лучшей модели до выброса:
| Модель | Конфиг | BR | SBR | MCR | Ранг |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash ★ | FP8 | 5,0 % | 0,9 % | 1,20 % | #1 |
| DeepSeek-V4-Flash | FP4 | 5,1 % | 0,9 % | 1,21 % | #2 |
| Qwen3.5-397B-A17B | FP8 | 5,5 % | 0,0 % | 0,36 % | #3 |
| GLM-5.1 | FP4 | 6,5 % | 0,3 % | 0,46 % | #4 |
| DeepSeek-V4-Pro | FP8 | 7,3 % | 0,7 % | 0,91 % | #5 |
| GLM-5.1 | FP8 | 10,2 % | 0,3 % | 0,44 % | #6 |
- BR Breach Rate
- доля ответов хотя бы с одним китайским символом
- SBR Severe Breach Rate
- доля серьёзных утечек — уровни L3–L4
- MCR Mean Char Ratio
- средняя доля китайских символов в ответе
Тяжесть утечек: доминирует L1
Каждый ответ классифицируется по пяти уровням вхождения китайского.
чисто
ни одного китайского символа в ответе
след
одиночные иероглифы, не образующие слова
частично
отдельные слова и фразы на китайском
преобладает
ответ наполовину или полностью на китайском
Откуда берутся утечки
Одни задачи провоцируют китайский почти всегда, другие — почти никогда.
Категории задач с наибольшей утечкой
Доля ответов с китайским внутри категории, все 21 конфигурация
Форматы чисел и дат
- 64,1 % Переводы (контроль)
- 57,1 % Неоднозначные инструкции
- 2,6 % Математика и логика — самая безопасная категория
Чувствительность к провокациям
Во сколько раз провокации усиливают утечку, все 21 конфигурация
медианный рост утечки на провокационных промптах
- 50,8× максимум — DeepSeek-V4-Pro FP8, с 1,1 % до 56,0 %
- 1,5 п.п. русский system-prompt снижает BR всего на
- ±1–2 % квантизация BF16 → 4-bit меняет BR в пределах
Рекомендации по внедрению
Выбор модели по компромиссу рассуждения / стоимость / безопасность / соответствие требованиям.
Критическая инфраструктура
Только суверенные российские модели (YandexGPT, GigaChat и аналоги). Открытые китайские LLM в критической инфраструктуре не применять.
Регулируемый финсектор (ЦБ РФ)
DeepSeek-V4-Flash FP8 + guardrails Tier 1–2: regex CJK-сканер, language-detection и WORM-аудит заблокированных ответов.
Нужен максимум качества рассуждений
GLM-5.1 FP4 с enable_thinking=false + Tier 1 guardrails: экономия вычислений и безопасность выше, чем у FP8.
Высоконагруженный, бюджетный инференс
DeepSeek-V4-Flash FP4 + Tier 1 guardrails — оптимальное соотношение стоимости и безопасности, стабильно < 6 % BR.