Обширная глоссэктомия при раке языка часто приводит к тяжёлым нарушениям речи, лишая пациентов привычного голоса и речевой идентичности. Исследователи из Индии оценили возможность предоперационной записи голоса пациента с последующим его воссозданием с помощью искусственного интеллекта для потенциального использования в качестве персонализированного средства коммуникации в послеоперационном периоде.
В проспективное одноцентровое пилотное исследование включили взрослых пациентов с ранее нелеченным раком языка, которым планировалась обширная глоссэктомия. Предоперационную запись голоса длительностью 30–60 секунд проводили однократно в звукоизолированной комнате.
Голоса клонировали офлайн с использованием модели IndicF5 flow-matching text-to-speech. Для каждого участника генерировали стандартизированный текст и индивидуальную транскрипцию.
Объективную оценку схожести голоса проводили с помощью косинусного сходства (cosine similarity) по трём независимым кодировщикам верификации говорящего, калиброванным относительно внутрииндивидуального распределения каждого пациента и распределения «самозванцев» в когорте. Дополнительно анализировали мел-кепстральное искажение (mel-cepstral distortion) и просодические характеристики.
Субъективная приемлемость оценивалась пациентами и членами семьи с помощью опросника Personalised Synthetic Voice Acceptance Questionnaire по шести доменам.
Из 34 включённых пациентов финальную когорту составили 26 пациентов на четырёх языках.
Объективные показатели схожести:
- Среднее косинусное сходство: 0.933 (Resemblyzer), 0.969 (WavLM) и 0.806 (ECAPA-TDNN)
- Показатели клонированных голосов в целом попадали в пределы внутрииндивидуального распределения пациентов и выше распределения «самозванцев» когорты
- Среднее мел-кепстральное искажение: 7.87 dB
- Основная частота (fundamental frequency) и другие просодические параметры показали широкое соответствие на уровне когорты с вариабельными индивидуальными отклонениями
Субъективная оценка:
- Домены «Идентичность и принадлежность» (Identity-and-Ownership) и «Аутентичность и доверие» (Authenticity-and-Trust) получили наивысшие оценки как от пациентов, так и от родственников
- Натуральность и эмоциональная приемлемость оценивались более сдержанно
Результаты демонстрируют техническую возможность создания персонализированных синтетических голосов из коротких (30–60 секунд) предоперационных записей клинического качества с объективной схожестью с оригиналом и предварительной приемлемостью со стороны пациентов и родственников.
Данные поддерживают дальнейшую оценку таких синтетических голосов как потенциального средства ассистирующей коммуникации в период послеоперационного восстановления.
Важное ограничение: настоящее исследование не оценивало фактическую эффективность коммуникации в послеоперационном периоде и клинические преимущества использования клонированных голосов — эти аспекты требуют дальнейшего изучения.
Исследование открывает новое направление в реабилитации онкологических пациентов после обширных операций на языке, предлагая технологический подход к сохранению важнейшего аспекта личной идентичности — собственного голоса.

