Разработка алгоритмов глубокого обучения в цифровой патологии требует значительных объёмов качественно аннотированных микроскопических изображений. Однако процесс аннотирования сопряжён с рядом трудностей: высокая стоимость, технические ограничения и отсутствие стандартизированной номенклатуры. Настоящая статья систематизирует подходы к аннотированию гистологических и цитологических изображений, рассматривает типовые задачи, уровни аннотации и форматы представления данных.
Высокая стоимость экспертной разметки остаётся основным барьером для создания крупных датасетов. Привлечение опытных патологоанатомов требует существенных временных и финансовых затрат. Технические ограничения связаны с большим размером цифровых слайдов (whole-slide images, WSI), что затрудняет работу с ними в стандартных программах аннотирования. Отсутствие единой номенклатуры и стандартов разметки снижает воспроизводимость и возможность объединения датасетов из разных источников.
Авторы выделяют несколько уровней детализации аннотации микроскопических изображений:
Уровень изображения (image-level) — присвоение метки всему слайду или фрагменту (например, «злокачественная опухоль» vs «доброкачественное образование»). Наиболее быстрый, но наименее информативный подход.
Уровень региона (region-level) — выделение области интереса (region of interest, ROI) с помощью полигонов или bounding box. Позволяет локализовать патологический процесс, но не даёт детальной информации о границах структур.
Уровень пикселя (pixel-level, semantic segmentation) — попиксельная разметка с присвоением каждому пикселю класса (строма, эпителий, некроз и т.д.). Наиболее трудоёмкий, но обеспечивает максимальную точность для задач сегментации.
Уровень объекта (instance segmentation) — идентификация и разметка отдельных клеток, ядер, желёз с уникальными метками для каждого объекта. Критичен для количественного анализа и морфометрии.
Для хранения аннотаций используются различные форматы: JSON (распространён в веб-платформах), XML, GeoJSON для полигональных координат, маски в форматах PNG или TIFF для семантической сегментации. Авторы подчёркивают важность выбора формата, совместимого с фреймворками машинного обучения (PyTorch, TensorFlow).
Облачные платформы (например, CVAT, Label Studio, платформы производителей сканеров) упрощают коллективную работу и управление версиями аннотаций. Стратегии предварительной фрагментации WSI на тайлы (tiles) оптимальных размеров (256×256, 512×512 пикселей) ускоряют процесс разметки и обучения моделей.
Ключевые рекомендации включают:
- Множественная разметка — привлечение нескольких экспертов для оценки межэкспертной согласованности (inter-rater agreement, например, коэффициент каппа Коэна).

