[연구의 필요성]
Open-Vocabulary Semantic Segmentation(OVSS)은 사전에 정해진 클래스에 국한되지 않고 임의의 텍스트로 주어진 객체를 영상에서 픽셀 단위로 분할하는 것을 목표로 한다. Segment Anything Model(SAM)과 같은 범용 분할 모델이 등장했지만, SAM 자체만으로는 텍스트가 지칭하는 객체를 정확히 찾아내기 어렵기 때문에 기존 연구에서는 다른 모델이 생성한 coarse mask를 SAM으로 정제하는 방식이 주로 사용되었다. 그러나 초기 mask가 부정확할 경우 SAM의 정제 결과 역시 크게 제한되는 문제가 존재한다.
[연구의 의미]
본 연구는 OVSS를 기존의 coarse-mask refinement 문제가 아니라 텍스트 기반 seed localization과 seed 기반 region expansion 문제로 재구성한 training-free 프레임워크 Text-to-Seed(T2S)를 제안한다. Stable Diffusion이 학습한 텍스트와 영상 영역 사이의 attention 정보를 활용하여 사용자가 입력한 클래스에 해당하는 위치의 sparse seed point를 생성하고, 이를 SAM의 point prompt로 전달하여 전체 객체 영역으로 확장한다. 이를 통해 Stable Diffusion의 강력한 semantic grounding 능력과 SAM의 정밀한 공간적 분할 능력을 별도의 task-specific 학습 없이 효과적으로 결합할 수 있다.
[연구 결과의 진행 상태 및 향후 계획]
T2S는 추가적인 task-specific annotation이나 학습 과정 없이 Pascal VOC, Pascal Context, Cityscapes, COCO Object, ADE20K 등 다양한 표준 OVSS 벤치마크에서 경쟁력 있는 성능을 달성하였다. 특히 부정확한 coarse mask에 의존하지 않고 높은 의미적 정확도를 갖는 seed를 먼저 탐색한 뒤 SAM으로 객체 영역을 확장하는 방식의 효과를 입증하였다. 향후에는 최신 diffusion 및 segmentation foundation model과의 결합, 복수 객체와 의미적으로 유사한 클래스가 동시에 존재하는 복잡한 장면에서의 seed 정확도 향상, 그리고 연산 효율 개선을 통해 보다 범용적인 open-vocabulary segmentation 시스템으로 확장할 수 있다.
국제 학술지 논문:
Kumju Jo, Heesun Jung, Sungyong Baik, "Text-to-Seed Generation: Training-Free Open-Vocabulary Seeded Semantic Segmentation via Re-Purposing Diffusion as Text-Guided Seed Generator," Knowledge-Based Systems, Vol. 351, Article 116698, 2026.
링크: https://www.sciencedirect.com/science/article/pii/S0950705126014243