학부뉴스

학부뉴스

논문실적 [논문, 백성용 교수님]T2S: 확산 모델을 텍스트 기반 시드 생성기로 활용하는 학습 없는 오픈보캐뷸러리 의미 분할 기법 새 글
2026-09-07 10:47:44 조회수10

[연구의 필요성]
Open-Vocabulary Semantic Segmentation(OVSS)은 사전에 정해진 클래스에 국한되지 않고 임의의 텍스트로 주어진 객체를 영상에서 픽셀 단위로 분할하는 것을 목표로 한다. Segment Anything Model(SAM)과 같은 범용 분할 모델이 등장했지만, SAM 자체만으로는 텍스트가 지칭하는 객체를 정확히 찾아내기 어렵기 때문에 기존 연구에서는 다른 모델이 생성한 coarse mask를 SAM으로 정제하는 방식이 주로 사용되었다. 그러나 초기 mask가 부정확할 경우 SAM의 정제 결과 역시 크게 제한되는 문제가 존재한다.

[연구의 의미]
본 연구는 OVSS를 기존의 coarse-mask refinement 문제가 아니라 텍스트 기반 seed localization과 seed 기반 region expansion 문제로 재구성한 training-free 프레임워크 Text-to-Seed(T2S)를 제안한다. Stable Diffusion이 학습한 텍스트와 영상 영역 사이의 attention 정보를 활용하여 사용자가 입력한 클래스에 해당하는 위치의 sparse seed point를 생성하고, 이를 SAM의 point prompt로 전달하여 전체 객체 영역으로 확장한다. 이를 통해 Stable Diffusion의 강력한 semantic grounding 능력과 SAM의 정밀한 공간적 분할 능력을 별도의 task-specific 학습 없이 효과적으로 결합할 수 있다.

[연구 결과의 진행 상태 및 향후 계획]
T2S는 추가적인 task-specific annotation이나 학습 과정 없이 Pascal VOC, Pascal Context, Cityscapes, COCO Object, ADE20K 등 다양한 표준 OVSS 벤치마크에서 경쟁력 있는 성능을 달성하였다. 특히 부정확한 coarse mask에 의존하지 않고 높은 의미적 정확도를 갖는 seed를 먼저 탐색한 뒤 SAM으로 객체 영역을 확장하는 방식의 효과를 입증하였다. 향후에는 최신 diffusion 및 segmentation foundation model과의 결합, 복수 객체와 의미적으로 유사한 클래스가 동시에 존재하는 복잡한 장면에서의 seed 정확도 향상, 그리고 연산 효율 개선을 통해 보다 범용적인 open-vocabulary segmentation 시스템으로 확장할 수 있다.

국제 학술지 논문:
Kumju Jo, Heesun Jung, Sungyong Baik, "Text-to-Seed Generation: Training-Free Open-Vocabulary Seeded Semantic Segmentation via Re-Purposing Diffusion as Text-Guided Seed Generator," Knowledge-Based Systems, Vol. 351, Article 116698, 2026.
링크: https://www.sciencedirect.com/science/article/pii/S0950705126014243

※ Knowledge-Based Systems는 인공지능, 지식기반 시스템 및 지능형 정보처리 분야를 다루는 Elsevier 국제학술지임.

T2S 개념도
T2S 개념표

Open-vocabulary segmentation 결과
Open-vocabulary segmentation 결과
 
사이트맵 닫기