Исследователи из Германии оценили способность большой языковой модели ChatGPT-4o извлекать стандартизированную классификацию PROMISE V2 из неструктурированных текстовых заключений ПСМА-ПЭТ/КТ и ПЭТ/МРТ у пациентов с раком предстательной железы. Структурированная отчётность повышает точность коммуникации между специалистами и улучшает клинические решения, но в рутинной практике и клинических исследованиях преобладают свободные текстовые описания.
Общая точность miTNM составила 79,8% для ПСМА-ПЭТ/КТ и значимо выше — 91,0% для ПСМА-ПЭТ/МРТ (OR = 2,80, 95% CI: 1,32–6,51, p = 0,003).
Попокомпонентный анализ:
- T-стадия: ПЭТ/МРТ превзошла ПЭТ/КТ (83,8% vs 57,7%; OR = 3,83, 95% CI: 1,34–12,69, p = 0,006)
- N-стадия: численно выше для ПЭТ/МРТ (100% vs 85,9%, p = 0,014)
- M-стадия: сопоставимая точность между модальностями (89,1% vs 95,7%; OR = 0,84, 95% CI: 0,20–4,19, p = 0,748)
Точность PRIMARY score также оказалась сопоставимой для ПЭТ/КТ и ПЭТ/МРТ (70,4% vs 88,1%; OR = 0,43, 95% CI: 0,05–2,14, p = 0,315).
Обоснование (rationale), которое ChatGPT-4o давал для своих классификаций, эксперты оценили как высокоправдоподобное: минимальный балл по шкале Likert составил ≥4,8 для miTNM и 4,1 для PRIMARY вне зависимости от модальности визуализации.
ChatGPT-4o обеспечивает надёжное извлечение N- и M-стадий по PROMISE V2 из свободных текстов заключений ПСМА-ПЭТ, но точность для T-стадии остаётся ограниченной. Работа демонстрирует первый шаг к использованию больших языковых моделей для поддержки структурированной и эффективной отчётности в ПСМА-ПЭТ визуализации и указывает на существующие ограничения технологии.

