Крупномасштабный биомедицинский анализ при раке простаты требует структурированных табличных данных, однако большинство клинической документации остается в текстовом формате. Стандартный подход ручной обработки данных требует больших временных затрат, подвержен ошибкам, не воспроизводим и дорог. Исследователи предположили, что локально развернутые большие языковые модели (LLM) с сохранением приватности в сочетании с традиционными методами обработки естественного языка (NLP) могут автоматически извлекать структурированные данные из отчетов биопсии простаты и патологоанатомических заключений.
Для исследования была локально развернута модель Mistral 7B для обработки 150 отчетов трансректальной ультразвуковой биопсии и гистопатологических заключений: 50 для разработки и 100 для валидации. Отчеты процедур анализировались либо с помощью одноэтапного промпта, либо многоэтапного смешанного LLM-NLP рабочего процесса с итеративной коррекцией ошибок. Более длинные гистопатологические отчеты структурировались исключительно с использованием многоэтапной стратегии промптинга.
LLM-структурированные выходные данные продемонстрировали высокое соответствие с данными, извлеченными человеком. Одноэтапный анализ отчетов процедур достиг точности 95,3% (991 правильный из 1040 дискретных точек данных) по всем извлеченным полям данных. Многоэтапный LLM-NLP конвейер достиг точности 98,0% (1314/1341) для отчетов ультразвуковых процедур.
При применении к гистопатологическим отчетам вертикально интегрированный подход достиг точности 99,6% (9110/9150) по диагнозу, степени злокачественности, ключевым гистологическим особенностям и картографированию локализации по столбцам биопсии. Ошибки группировались в неоднозначных случаях с нечеткими дескрипторами или необычными структурами отчетности, отличающимися от институциональной документационной культуры.
Локально развернутая LLM с сохранением приватности может точно и эффективно преобразовывать неструктурированные радиологические и патологоанатомические отчеты биопсии простаты в структурированные табличные наборы данных. При незначительной адаптации этот подход обобщается на другие типы отчетов и поддерживает масштабируемую инженерию данных для клинических исследований, контроля качества и разработки моделей машинного обучения.
