Точная воксельная сегментация лёгочных узлов на грудной КТ необходима для измерения диаметра и объёма, отслеживания роста и количественной оценки при скрининге рака лёгкого. Задача остаётся сложной: узлы различаются по плотности, размеру, контакту с сосудами или плеврой, а клинически значимая морфология часто локализована в тонком, неоднозначном крае. Существующие системы обычно жертвуют точностью контура ради скорости — большие foundation-модели с промптами могут быть точными, но медленными, тогда как компактные CNN- или SSM-декодеры эффективны, но склонны сглаживать спикулированные и матово-стекловидные границы.
Исследователи предложили HSV-Net (Hybrid State-space–Vision Network) — двухпоточную 3D-сеть, не требующую промптов после локализации узла. SSM3D-поток обеспечивает контекст всего патча с state-space блоками линейной сложности, а OrthoLoRA-поток адаптирует замороженные DINOv2-признаки на аксиальных, коронарных и сагиттальных срезах. Hybrid Gated Mixer (HGM) объединяет оба потока перед FPN-декодированием, а Progressive Contour Learning (PCL) контролирует overlap, геометрию signed-distance-field и уточнение контура с взвешиванием неопределённости.
На валидационном подмножестве QIN Lung CT/QIN-LungCT-Seg из 10 пациентов (n = 12 опухолей; вложенная пациент-уровневая 5-fold CV) HSV-Net показала наивысший средний Dice 90,1% ± 1,0% (95% CI [88,9; 91,3]) и Boundary F1 86,3% ± 1,3% среди сравниваемых методов на патчах 128×128×64 с латентностью 58 мс. Стандартный полнообъёмный nnU-Net v2 достиг 88,6% ± 1,0% Dice на тех же QIN-фолдах — ниже, чем HSV-Net.
На независимом бенчмарке LIDC-IDRI с экспертными консенсусными масками (186 пациентов/294 узла; пациент-уровневая 5-fold CV внутри LIDC, без переноса QIN→LIDC) HSV-Net достигла 87,8% ± 1,1% Dice и 83,6% ± 1,3% Boundary F1, превзойдя полнообъёмный nnU-Net (87,1% ± 1,0% Dice). LUNA16 использовали только как прокси-проверку размера/локализации с диаметр-согласованными сферическими референсами, а не для внешней валидации контура.

