Исследователи протестировали четыре конфигурации больших языковых моделей — GPT-4o, GPT-5.4 и две конфигурации платформы DeepSeek (DS-Fast и DS-Expert) — на наборе из 1053 экзаменационных вопросов для подготовки к Китайскому национальному квалификационному экзамену по радиационной онкологии (промежуточный уровень, 2025 год). Оценивали точность ответов, долю идентичных ответов между моделями, консенсус по точности и задержку генерации ответа.
Все четыре конфигурации тестировали с использованием идентичного zero-shot промпта на китайском языке. Точность рассчитывали с 95% доверительными интервалами Уилсона. Попарные различия в первичном анализе на китайском языке оценивали точным критерием Макнемара с поправкой Холма. Дополнительно провели описательный анализ, контролируемый по языку: те же вопросы перевели на английский и протестировали с эквивалентным англоязычным промптом.
Общая точность составила:
- GPT-4o: 56,7% (95% CI, 53,7–59,7)
- GPT-5.4: 66,1% (95% CI, 63,2–68,9)
- DS-Fast: 98,4% (95% CI, 97,4–99,0)
- DS-Expert: 99,8% (95% CI, 99,3–99,9)
Все шесть попарных сравнений остались статистически значимыми после поправки Холма.
DS-Fast и DS-Expert дали идентичные ответы на 1034 из 1053 вопросов (98,2%), и все эти ответы были правильными. GPT-5.4 и DS-Expert показали 100% условную точность среди совпадающих ответов, но доля идентичных ответов составила лишь 65,9% (694/1053).
Задержка генерации ответа (model-reported latency) была наименьшей для DS-Fast (0,68 ± 1,00 секунды) и наибольшей для DS-Expert (3,69 ± 2,24 секунды).
При тестировании на переведённых на английский вопросах общая точность составила:
- GPT-4o: 62,6%
- GPT-5.4: 61,5%
- DS-Fast: 66,5%
- DS-Expert: 76,9%
DS-Expert сохранил наивысшую точность, но преимущество над GPT-моделями существенно сократилось по сравнению с китайскоязычной версией.
Конфигурации DeepSeek значительно превзошли GPT-модели на этом наборе экзаменационных вопросов по лучевой терапии на китайском языке, причём DS-Expert достиг наивысшей точности 99,8%. Однако производительность существенно зависела от языка вопросов: при переводе на английский разница между моделями уменьшилась.
Авторы подчёркивают, что полученные данные поддерживают дальнейшую оценку использования этих моделей для проверки ответов и разбора тренировочных вопросов, но не устанавливают образовательную эффективность таких инструментов в реальной клинической подготовке специалистов по радиационной онкологии. Необходимы проспективные исследования с оценкой долгосрочного влияния на обучение и клиническую практику.

