| 제 목 | 조대웅 교수, 멀티모달 AI·의료 영상-언어 연구 2편, 탑티어 AI 학회 NeurIPS 2026 채택 | ||||
|---|---|---|---|---|---|
| 작성자 | 관리자 | 작성일 | 2026-09-30 | 조회수 | 176 |
| 첨부파일 | |||||
| 경북대학교 전자공학부 인공지능학과 조대웅 교수가 참여한 연구 논문 2편이 인공지능·머신러닝 분야 세계 최고 수준의 학술대회인 NeurIPS 2026(Conference on Neural Information Processing Systems)에 채택됐다. 조대웅 교수는 두 논문에 각각 제1저자와 공동교신저자로 참여했다. 이번에 채택된 두 연구는 영상·음성·텍스트 등 서로 다른 형태의 정보를 효과적으로 활용하는 멀티모달 인공지능을 공통 주제로 한다. 첫 번째 연구는 서로 다른 구조의 데이터 사이에서 지식을 전달하는 멀티모달 지식 증류 기술을, 두 번째 연구는 흉부 X-ray와 방사선 판독문을 활용해 질병 중증도와 같은 세밀한 임상 정보를 보존하는 의료 영상-언어 학습 기술을 다룬다. > 서로 다른 구조의 데이터 사이에서 지식을 전달하는 멀티모달 지식 증류 첫 번째 논문 **“Codebook-Guided Cross-Modal Knowledge Distillation for Structurally Heterogeneous Features”**는 영상과 음성처럼 구조가 크게 다른 데이터 사이에서도 효과적으로 지식을 전달하기 위한 새로운 교차 모달 지식 증류(Cross-Modal Knowledge Distillation) 방법을 제안했다. 지식 증류는 성능이 높은 교사(teacher) 모델의 정보를 학생(student) 모델에 전달하는 기술이다. 멀티모달 환경에서는 학습 단계에서 여러 종류의 정보를 사용할 수 있지만, 실제 사용 단계에서는 센서나 비용 등의 제약으로 일부 정보만 이용할 수 있는 경우가 많다. 이때 학습 과정에서만 사용할 수 있는 모달리티의 정보를 실제 배포되는 학생 모델에 효과적으로 전달하는 것이 중요하다. 그러나 영상 특징은 2차원 공간 형태로, 음성이나 텍스트 특징은 1차원 순차 형태로 구성되는 등 모달리티마다 내부 표현 구조가 크게 다르다. 기존 특징 기반 지식 증류 방식은 이러한 서로 다른 특징을 직접 대응시키는 경우가 많아, 구조적 차이가 클수록 의미 있는 정보를 전달하기 어렵다는 한계가 있다. 연구진은 이를 해결하기 위해 교사 모델의 특징을 벡터 양자화 기반 코드북(codebook)으로 변환하고, 그중 과제 수행에 중요하면서 학생 모델이 활용하기 적합한 정보를 선별해 전달하는 방법을 개발했다. 직접적인 특징 간 일대일 대응 대신, 교사 모델의 정보를 공통적으로 활용할 수 있는 코드 형태로 추상화해 서로 다른 구조 사이의 지식 전달을 가능하게 하였다. 연구진은 음성-영상, 이미지-텍스트, RGB-깊이(depth) 등 다양한 멀티모달 환경에서 제안 방법을 검증했다. 분류 실험에서는 8개의 지식 전달 설정 중 7개에서 가장 높은 성능을 기록했으며, RGB와 깊이 정보를 활용한 의미론적 분할에서도 대부분의 주요 평가 지표에서 높은 성능을 보였다. > 질병 중증도와 같은 세밀한 임상 정보를 보존하는 의료 영상-언어 AI 두 번째 논문 “FinAl: Fine-grained Alignment for Detail-Preserving Medical Vision-Language Pretraining”은 흉부 X-ray와 방사선 판독문을 함께 학습하는 의료 인공지능이 단순한 질환 유무뿐 아니라 질병의 중증도와 같은 세밀한 임상 정보까지 보다 잘 표현할 수 있도록 하는 의료 영상-언어 사전학습 기술을 제안했다. 기존 의료 영상-언어 모델은 대규모 X-ray 영상과 판독문을 대조학습(contrastive learning) 방식으로 학습하는 경우가 많다. 하지만 이 과정에서는 정답으로 연결된 영상과 판독문 이외의 사례를 대부분 서로 다른 것으로 취급하기 때문에, 실제로는 임상적으로 유사하거나 인접한 중증도를 가진 환자들 사이의 관계가 충분히 반영되지 않을 수 있다. 연구진이 제안한 FinAl은 구조화된 방사선 판독문 사이의 상대적인 의미 관계를 이용해 학습 신호를 구성한다. 단순히 서로 같은지 다른지만 구분하는 대신, 임상적으로 얼마나 가까운지를 학습에 반영함으로써 질병의 미세한 차이를 영상 표현에 보존하도록 했다. 또한 영상과 언어 표현이 학습되는 정도에 따라 정렬 강도를 조절하는 방법을 함께 적용했다. 이 과정에서 별도의 중증도 라벨을 사전학습 단계에 직접 제공하지 않고도 세밀한 임상적 관계를 학습할 수 있도록 설계했다. 흉부 X-ray 중증도 분류와 의료 영상·텍스트 검색 실험에서 FinAl은 대부분의 세밀한 임상 평가 조건에서 기존 의료 영상-언어 모델보다 향상된 성능을 보였다. 또한 사전학습된 영상 모델을 고정하고 간단한 분류기만 학습하는 평가에서도 높은 성능을 기록해, 제안 방법이 학습한 영상 표현 자체에 중증도와 같은 세부 임상 정보가 보다 잘 반영됐음을 확인했다. 조대웅 교수팀은 멀티모달 인공지능의 학습 원리와 방법론에 대한 기초 연구와 실제 문제에 적용하는 응용 연구를 함께 수행하고 있다. 향후 의료를 비롯해 영상·음성·텍스트 등 다양한 정보가 함께 활용되는 분야에서 멀티모달 인공지능의 학습 방법론과 실제 응용에 관한 연구를 지속적으로 확대할 계획이다. |
|||||
| [좋아요 1 ] | |||||



