Одной из причин исследователи называют неравномерное представительство языков в данных, на которых обучаются ИИ-модели. Например, в корпусе ROOTS (крупном наборе текстов на разных языках для обучения ИИ) на английский приходится 30,03% данных, китайский – 16,16%, французский – 12,9%, испанский – 10,85%. Еще заметнее дисбаланс в специализированных медицинских данных: MMedC объемом 25,5 млрд токенов (слов и частей слов, на которые ИИ разбивает текст при обработке) включает шесть языков, причем 41,4% приходится на английский. Арабский, хинди, бенгальский и португальский в нем отсутствуют.
Чтобы оценить последствия такого дисбаланса, авторы отобрали 442 вопроса из MedQA (набора заданий медицинских лицензионных экзаменов) на английском и китайском языках. Вопросы перевели на арабский, бенгальский, хинди и португальский, после чего предложили их четырем моделям – DeepSeek Chat от DeepSeek, Gemini 2.5 Flash от Google, GPT-3.5 Turbo и GPT-4o от OpenAI.
Затем исследователи сравнили результаты с показателями моделей на исходных английских и китайских вопросах. Для португальского точность снизилась всего на 0,73%, хинди – на 4,64%, бенгальского – на 7,24%, арабского – на 10,29%. Небольшое снижение для португальского авторы связывают с его близостью к другим романским языкам, которые лучше представлены в обучающих данных. Результаты, по их мнению, показывают, что способность современных LLM хорошо переводить тексты не позволяет полностью компенсировать нехватку обучающих данных на отдельных языках. Часть выявленных различий могла быть связана с ошибками автоматического перевода вопросов, что авторы называют одним из ограничений эксперимента.
По словам исследователей, в здравоохранении значение имеет не только язык, на котором пациент обращается к ИИ, но и страна его проживания. Клинические рекомендации и распространенность заболеваний могут различаться в зависимости от региона, поэтому одинаковые ответы модели не всегда подходят пользователям из разных стран. Авторы предлагают учитывать местные медицинские стандарты, в частности, с помощью RAG-систем (технологии, при которой ИИ перед ответом получает информацию из заданных источников), подключенных к актуальным региональным клиническим рекомендациям.
Еще одним направлением исследователи называют создание международной базы клинических рекомендаций из разных стран и расширение многоязычных медицинских наборов данных, размеченных специалистами. Кроме того, предлагается разработать специальные тесты для проверки качества медицинских LLM на разных языках, регулярно публиковать результаты таких проверок и учитывать обратную связь врачей и пациентов.
По мнению авторов, языковые различия должны стать отдельным критерием оценки медицинских ИИ-систем. Если модели будут хорошо работать преимущественно с языками, широко представленными в обучающих данных, внедрение таких технологий может дать пользователям неравный доступ к надежной медицинской информации в зависимости от того, на каком языке они говорят.
Проблема языкового неравенства актуальна и для доступа к медицинским знаниям в целом. Специалисты Елецкого государственного университета им. И.А. Бунина выяснили, что 85% опрошенных студентов медицинского факультета считают изучение иностранного языка важной частью подготовки врача. При этом 51,7% респондентов назвали главным преимуществом владения английским возможность читать научную литературу в оригинале, а 19% – общаться с зарубежными коллегами и пациентами.
Подписывайтесь на наши каналы: в MAX – Vademecum и Vademecum Live, в Telegram – Vademecum и Vademecum Live.