최신연구
-
[이근배, 김형훈 교수] Progressive Facial Granularity Aggregation with Bilateral Attribute-based Enhancement for Face-to-Speech..
Progressive Facial Granularity Aggregation with Bilateral Attribute-based Enhancement for Face-to-Speech Generation [연구의 필요성] 뇌졸중과 같은 외상적 사건을 겪은 개인들은 발화 기능에 심각한 제약을 받아 음성을 통한 의사소통이 불가능해지는 경우가 많습니다. 이러한 상황에서 음성합성 기술은 의사소통을 보조하는 수단으로 활용될 수 있으나, 기존의 TTS는 사용자 고유의 음색을 반영하지 못한다는 한계가 있습니다. 따라서 사용자의 얼굴 이미지를 기반으로 목소리를 예측하고, 이를 활용하여 개인의 고유한 음성을 복원·합성하는 기술은 기존 보조 의사소통 기술의 한계를 극복하고, 사용자 정체성과 심리적 만족감을 동시에 보장할 수 있다는 점에서 중요한 연구적 의의를 갖습니다. [포스텍이 가진 고유의 기술] 본 연구에서는 말을 하지 못하는 화자를 위한 개인 맞춤형 음성 합성 기술을 제안하며, 이를 구현하기 위해 zero-shot 다화자 TTS 모델을 개발하였습니다. 기존 연구들이 다단계 파이프라인이나 외부 사전학습 모델에 의존하는 것과 달리, 본 연구에서는 로컬 얼굴 특징을 점진적으로 통합하여 speaker representation을 형성하고, 성별 및 인종과 같은 특성에 대한 추가적 지도학습(supervised learning)을 적용하였습니다. 또한, 동일 화자의 다양한 얼굴 각도 이미지를 음성과 매칭하는 데이터 증강 기법을 도입하여, 특정 화자의 얼굴 이미지에서 목소리를 예측할 수 있었습니다. [연구의 의미] 본 연구는 얼굴 이미지를 기반으로 화자의 목소리를 예측하고, 이를 활용하여 음성을 합성할 수 있음을 입증함으로써, 새로운 보조 기술 개발의 가능성을 제시합니다. [연구결과의 진행 상태 및 향후 계획] 아예 말을 하지 못하는 사람을 대상으로, 얼굴 근육 신호를 음성으로 생성하는 보조기술 연구를 진행하고자 합니다. [성과와 관련된 실적] EMNLP 2025 Findings Accept/ 전예진, 김영재, 이지현, 김형훈, 이근배 / Progressive Facial Granularity Aggregation with Bilateral Attribute-based Enhancement for Face-to-Speech Generation [성과와 관련된 이미지]
이근배, 김형훈 교수 2025.09.04 1482 -
[이근배, 옥정슬 교수] MiLQ: Benchmarking IR Models for Bilingual Web Search with Mixed Language Queries
[연구의 필요성] 실세계에서 이중언어 사용자가 웹 검색이나 AI 에이전트와 소통할 때 언어를 혼합하여 쓰는 것은 자연스러운 현상이며, 이는 검색 시스템의 사용자 경험을 좌우하는 핵심 요소이다. 하지만 이러한 혼합 언어 질의(Mixed-language Query) 환경을 반영하고 검색 모델의 성능을 평가할 공개 벤치마크 데이터셋은 전무했다. 이로 인해 검색 모델이 실제 혼합 언어 질의를 효과적으로 처리하는지 평가할 데이터와 방법이 부재했고, 이중언어 사용자의 검색 경험을 개선하는 모델 개발에 직접적인 한계로 작용했다. 이는 다양한 언어를 자유롭게 구사하는 다국어 화자의 혼합 언어 질의에 강건하게 반응하는 정보 검색 시스템 개발을 위한 기반 연구의 중요성과 필요성을 시사한다. [포스텍이 가진 고유의 기술] 본 연구에서는 최초로 실제 이중언어 사용자가 제작한 Mixed-Language Query 벤치마크(MiLQ)를 구축했다. 8개 언어권의 이중언어 사용자들에게 정교한 지시 사항과 기존 모국어 및 영어로 구성된 질의 데이터셋을 제공하고, 이를 바탕으로 가장 자연스럽고 현실적인 혼합 언어 질의를 생성하도록 했다. 이렇게 구축된 MiLQ는 GPT-Eval과 Human-Eval 등 지표를 통해 높은 품질을 검증받았으며, 별도의 선호도 조사에서는 실제 다른 이중언어 사용자들이 기존 단일 언어 질의보다 혼합 언어 질의를 더 선호하는 것으로 나타났다. 나아가, 구축한 벤치마크를 기반으로 최신 다국어 정보 검색 모델들의 초기 성능 기준(baseline)을 제시했다. 또한, 인공적으로 생성한 코드 스위칭 데이터로 학습시킨 'Mixed-Distill' 모델을 통해, 이러한 코드스위칭 데이터가 강건한 다국어 검색 시스템 개발에 기여할 수 있다는 가능성을 입증했다. [연구의 의미] 본 연구는 그동안 공개 벤치마크의 부재로 다뤄지지 못했던 혼합 언어 정보 검색(MQIR) 분야의 기준이 되는 연구라는 점에서 큰 의미를 가진다. 이번에 구축한 MiLQ 벤치마크는 향후 관련 연구를 촉진하고, 여러 모델의 성능을 객관적으로 비교하는 기준을 제공한다. 또한, 본 연구는 이중언어 사용자가 의도적으로 영어를 혼용하는 것이 영어 문서 검색에 효과적인 전략임을 실험으로 확인했으며, 토큰 수준의 분석을 통해 그 원인을 밝혔다. 이 연구 결과는 실제 이중언어 사용자의 다양한 언어 표현 방식을 반영하여 더 현실적이고 안정적인 정보 검색 시스템을 개발하는 데 기여할 수 있다. [연구결과의 진행 상태 및 향후 계획] 본 연구는 자연어처리 분야 최우수 국제학술대회인 EMNLP 2025에 소개될 예정이며, 구축된 MiLQ 데이터셋은 ELRA(ELRA Language Resources Association)를 통해 무료 평가 라이선스(Free Evaluation License)로 공개하기 위한 등록 절차를 진행 중이다. 추후에는 혼합 언어 범위를 확장하고 언어별 특성을 분석할 계획이다. 또한, 사용자의 질의가 모국어, 영어, 혼합 언어 등 어떤 형태이든 일관되고 강건한(robust) 성능을 보이는 검색 방법론을 연구해 나갈 예정이다. [성과와 관련된 실적] Jonghwi Kim, Deokhyung Kang, Seonjeong Hwang, Yunsu Kim, Jungseul Ok, Gary Geunbae Lee, MiLQ: Benchmarking IR Models for Bilingual Web Search with Mixed Language Queries, EMNLP 2025 [성과와 관련된 이미지] [그림1] 문제 상황 [그림 2] 토큰 수준의 분석 결과
이근배, 옥정슬 교수 2025.09.04 1596 -
[이근배, 김형훈 교수] PanicToCalm: A Proactive Counseling Agent for Panic Attacks
[연구의 필요성] 공황발작은 예측 불가능하고 갑작스럽게 찾아와 즉각적이고 안정적인 개입이 필요하지만, 실제 상담 데이터를 수집하기 어렵습니다. 따라서 공황 상황에 특화된 AI 기반 심리적 응급처치(PFA) 모델이 요구됩니다 [포스텍이 가진 고유의 기술] PFA(심리적 응급처치)에 기반한 PACE 데이터셋 구축 LoRA 기반 PACER 모델 개발 (공황 발작 상황에서 공감적이면서도 지시적인 개입 제공). 특히 학습 과정에서 시뮬레이터로 부터 preference signal을 받아 선호 학습 진행 위기 개입 평가를 위한 PANICEVAL 프레임워크 제안 [연구의 의미] 기존의 일반 상담/CBT 모델들이 고강도 위기 상황에서는 적합하지 못한 한계를 극복하고, 공황발작 환자에게 즉각적이고 실질적인 도움을 제공할 수 있는 최초의 PFA 기반 AI 상담 체계를 제시했습니다. 이는 위기 상황에서의 AI 활용 가능성을 크게 확장하는 의미를 가집니다. [연구결과의 진행 상태 및 향후 계획] 현재: PACE 데이터셋 구축 및 PACER 모델 학습, PANICEVAL 평가로 효과 검증 완료. 결과: PACER는 기존 모델(GPT-4o, CBT 모델 등) 대비 안정화와 지시적 개입 측면에서 우수한 성능을 입증.향후 계획: 실제 환자 대상의 실시간 평가, 멀티모달 입력(음성·표정) 확장, 임상 환경 적용 가능성 검증. [성과와 관련된 실적] 2025 EMNLP Main Accept/ 이지현, 민예진, 김산, 전예진, 양성준, 김형훈, 이근배 /PanicToCalm: A Proactive Counseling Agent for Panic Attacks [성과와 관련된 이미지]
이근배, 김형훈 교수 2025.09.04 1644 -
[이근배, 김형훈 교수] KOBLEX: Open Legal Question Answering with Multi-hop Reasoning
[연구의 필요성] 최근 대규모 언어 모델(LLM)이 법률 분야에서도 탁월한 성능을 보이고 있지만, 여전히 한계가 존재한다. 기존의 법률 벤치마크들은 대부분 객관식이나 이진 분류에 치중되어 있어, 여러 법 조항을 종합적으로 추론해야 하는 개방형 질문에 대한 LLM의 능력을 제대로 평가하지 못한다. 특히, 법률 분야에서는 부정확하거나 허위적인 정보가 심각한 결과를 초래할 수 있으므로, 답변의 정확성과 근거 조항에 대한 신뢰성 확보가 매우 중요하다. 이러한 문제를 해결하기 위해서는 법 조항에 기반한 심층적인 다단계 추론 능력을 평가할 수 있는 새로운 벤치마크와 방법론이 필요하다. [포스텍이 가진 고유의 기술] 우리 연구팀은 법률 AI의 한계를 극복하기 위해 새로운 한국어 법률 질의응답 벤치마크를 개발했고, 이에 대응하는 방법론 또한 연구했다. - KoBLEX 벤치마크: 법률 전문가와 LLM이 협력하여 구축한 한국 법률 질의응답 벤치마크이며, 다수의 법 조항을 연결해 추론해야 하는 226개의 시나리오 기반 질문과 정답, 그리고 관련 법 조항으로 구성되어 있다. 특히, 기존 벤치마크와 달리 정답의 근거가 되는 법 조항을 명확히 제시해야하는 과제에 초점을 맞추고 있다. - ParSeR 방법론: 복잡한 법률 질문에 대한 관련 법 조항을 효과적으로 검색하는 새로운 방법론이며, LLM의 내재된 지식을 활용하여 '매개변수적 법 조항(parametric provisions)'을 생성하고, 이를 검색 쿼리로 사용해 실제 법 조항 코퍼스에서 가장 관련성 높은 조항을 찾아낸다. 이후 3단계(검색-재순위화-선택) 검색 과정을 통해 신뢰할 수 있는 법적 근거를 확보하고, 이를 바탕으로 정확한 답변을 생성한다. [연구의 의미] KoBLEX benchmark는 LLM이 법 조항에 근거하여 논리적이고 정확한 답변을 생성하는 능력을 평가하는 새로운 표준을 제시한다. 또한, ParSeR는 다단계 추론이 필요한 복잡한 법률 문제에 대해 기존 방법론보다 훨씬 뛰어난 성능을 보인다. 이는 법률 AI 연구의 새로운 방향성을 제시하는 데 크게 기여할 것이다. [연구결과의 진행 상태 및 향후 계획] 현재 코드 및 데이터셋의 공개가 완료되었으며, 추후 질의응답 시스템을 더 개선할 예정이다. [성과와 관련된 실적] Jihyung Lee*, DaeHee Kim*, Seonjeong Hwang, Hyounghun Kim, Gary Lee/ KOBLEX: Open Legal Question Answering with Multi-hop Reasoning EMNLP 2025 Main Accept [성과와 관련된 이미지]
이근배, 김형훈 교수 2025.09.04 2258 -
[한욱신 교수] SAFE: Schema-Driven Approximate Distance Join for Efficient Knowledge Graph Querying
[연구의 필요성] 대규모 지식그래프(KG)를 활용한 질문응답 시스템은 신뢰할 수 있는 답변을 주기 위해 두 가지가 동시에 필요하다. 하나는 사용자의 질문을 그래프 형태로 정확하게 바꾸는 것이고, 다른 하나는 그 그래프와 맞는 부분을 거대한 지식그래프 속에서 빠르게 찾아내는 것이다. 지금까지 연구들은 크게 세 가지 방식으로 접근해왔다. 첫째, 질문을 SPARQL 같은 쿼리 언어로 변환하는 방식은 잘못된 변환이 이루어지면 전체 과정이 무너진다는 문제가 있다. 둘째, LLM이 직접 그래프를 탐색하는 에이전트 방식은 질문에 포함된 핵심 개체를 미리 알아야 하고, LLM을 여러 번 불러야 하므로 비효율적이다. 셋째, 질문을 그래프로 바꾼 뒤 그대로 지식그래프에 대입하는 방식은 실제 지식그래프와 구조가 조금만 달라도 매칭이 어렵다. 따라서 기존 방법들은 모두 대규모 지식그래프 환경에서 정확도와 효율성을 동시에 만족시키기 어렵다는 공통의 한계를 가진다. [포스텍이 가진 고유의 기술] 본 연구진은 SAFE(Schema-Driven Approximate Distance Join)라는 새로운 프레임워크를 제안하였다. SAFE의 핵심은 스키마 그래프를 활용해 질문을 그래프로 표현하는 과정에서 생기는 불완전함을 보정하고, 효율적으로 정답 후보를 찾는 것이다. SAFE는 네 단계로 이루어진다. 먼저 LLM이 질문을 바탕으로 초기 그래프를 생성하고, 이후 스키마 그래프에서 근사 탐색을 통해 이 구조를 보정한다. 이때, 질문을 해석하는 과정에서 중요한 연결이 빠지거나 불필요한 노드가 들어가는 실수가 생기더라도 SAFE는 이를 근사적인 경로로 대체해 자연스럽게 연결한다. 이렇게 하면 질문 해석 과정의 오류가 있어도 관련 있는 후보를 여전히 찾을 수 있다. 또한 방대한 지식그래프 전체를 탐색하는 대신, 그 구조를 단순화한 스키마 그래프에서 미리 거리 정보를 계산해 두어 훨씬 빠르고 가볍게 탐색을 진행한다. 다음 단계에서는 타입 제약과 의미적 유사도를 함께 고려해 후보들을 순위화한다. 마지막으로 LLM이 이렇게 좁혀진 후보 그래프를 근거로 최종 답변을 생성한다. [연구의 의미] 본 연구는 기존 방법들이 가진 구조적 불일치와 비효율 문제를 동시에 해결할 수 있는 새로운 패러다임을 제시했다는 점에서 의미가 크다. SAFE는 WebQSP, CWQ, GrailQA 같은 대표적인 벤치마크에서 최신 기법들을 안정적으로 뛰어넘는 성능을 보였다. 특히 새로운 유형의 질문이나 처음 보는 조합에 대해서도 정확도가 높게 유지되었다. 예를 들어 CWQ에서는 79.4%, WebQSP에서는 90.6%, GrailQA 전체에서는 85.5%라는 높은 성능을 기록하였다. 또한 SAFE는 효율성에서도 강점을 보였다. 기존 기법들이 질문 하나를 처리할 때 평균 6회 이상 LLM 호출이 필요했다면, SAFE는 단 두 번의 호출만으로 충분했다. 그 결과 토큰 사용량과 응답 시간 모두 절반 이상 줄어들었다. 단계별 분석 결과, 전체 응답 지연의 대부분은 LLM이 초기 질의 그래프를 만드는 과정에서 발생했으며, 그 이후의 근사 탐색과 매칭 과정은 안정적이고 빠르게 동작하였다. 아울러 모듈별 실험을 통해 근사 거리 탐색, 의미 기반 매칭, 타입 제약 모두가 정확한 답변 생성에 필수적임을 확인하였다. [연구결과의 진행 상태 및 향후 계획] 본 연구진은 SAFE가 현재 ORDER BY, LIMIT, UNION, 복잡한 FILTER와 같은 고급 연산 처리까지 확장하여 더 복잡한 질문에도 대응할 수 있도록 발전시킬 계획이다. 또한 응답 지연의 주요 원인이 되는 초기 질의 그래프 생성 과정을 더 효율적으로 만들기 위해, 프롬프트 최적화와 LLM 추론 경량화를 연구 중이다. 향후에는 더 다양한 유형의 질문과 실제 대규모 지식그래프 환경에서의 실시간 응용을 목표로 하고 있다. [성과와 관련된 실적] Sangoh Lee, Sungho Park, Wook-Shin Han. “SAFE: Schema-Driven Approximate Distance Join for Efficient Knowledge Graph Querying”, EMNLP 2025 Main Conference [성과와 관련된 이미지] 그림 1. 기존 방법들이 질의와 관련된 서브그래프를 정확히 검색하지 못하는 세 가지 사례를 보여주는 예시그림 2. SAFE 프레임워크의 전반적인 동작 과정
한욱신 교수 2025.09.03 1681 -
[한욱신 교수] LILaC: Late Interacting in Layered Component Graph for Open-domain Multimodal Multihop Retrieval
[연구의 필요성] 멀티모달 문서(웹페이지·PDF 등)에서 문단·표·이미지처럼 서로 연결된 구성요소를 찾아주는 검색기는, (1) 고정된 단일 단위로만 검색해 불필요한 내용이 섞이는 ‘그라뉼러리티(단위) 문제’와 (2) 하이퍼링크·동일 페이지 등 구성요소 사이의 구조적 연결을 살리지 못해 ‘멀티홉 추론 문제’가 동시에 발생한다. 텍스트 요약 기반(TextRAG) 접근은 시각 정보를 텍스트로 바꾸는 과정에서 핵심 단서가 누락되기 쉽고, 스크린샷 기반(VisRAG) 접근은 보통 ‘페이지 전체’처럼 거친 단위로 임베딩해 질의와 무관한 부분이 많이 섞이며 구성요소 간 링크를 잃어버린다. 이로 인해 정밀 검색과 다단계 추론이 모두 제한된다. [포스텍이 가진 고유의 기술] 본 연구진은 LILaC이라는 새로운 검색 프레임워크를 제안한다. 핵심은 두 가지이다. (1) 이층(layered) 구성요소 그래프: 문단·표·이미지를 ‘문단/표/이미지(거친 단위)’와 ‘문장/표-행/이미지-객체(미세 단위)’의 2계층으로 표현하고, 문서 내·문서 간 관계(하이퍼링크 등)는 상층 간의 엣지로, 상·하층 간 포함 관계는 계층 하향 엣지로 명시한다. 이렇게 하면 후보 생성은 거친 단위에서 빠르게, 최종 판단은 미세 단위에서 정밀하게 할 수 있다. (2) ‘지연 상호작용(late interaction)’ 기반 서브그래프 검색: 온라인 단계에서 질의를 하위 질의로 분해하고(모달리티 분류 포함), 상층 노드에서 후보를 찾은 뒤 빔 서치로 연결 엣지를 따라 확장한다. 각 엣지 점수는 엣지 양 끝의 ‘미세 하위 구성요소(문장·표-행·객체)’와 하위 질의 간 최대 유사도를 합산해 동적으로 계산한다(엣지 임베딩을 전수 계산하지 않아도 됨). 고립 노드·편측 매칭 같은 특수 경우도 처리한다. 요약하면, LILaC은 ‘이층 그래프 표현 + 지연 상호작용 서브그래프 탐색’으로 멀티모달·다단위 정보를 효율적이면서도 정밀하게 결합한다 [연구의 의미] LILaC은 추가 파인튜닝 없이 5개 벤치마크 모두에서 SOTA 성능을 달성했다. 특히 VisRAG-Ret·ColPali 대비 평균 Recall@3은 각각 12.39%p·9.85%p, MRR@10은 14.45%p·10.49%p 크게 향상됐다. 데이터셋 중에서도 미세 단위·멀티홉 추론이 중요한 MultimodalQA·MMCoQA에서 상대 개선이 두드러진다. 엔드투엔드 QA에서도 Qwen2.5-VL 7B 조합 기준 평균 EM 52.00, F1 58.79로 기존 최적 VisRAG 설정 대비 EM 17.40%p, F1 18.47%p 상승을 보였다. 이는 요약 과정에서 시각 정보가 손실되는 TextRAG의 한계를 넘어, 시각·표·텍스트를 구조적으로 유지한 채 정밀 검색을 수행한 효과로 해석된다. 효율성 측면에서도, 전체 평균 실행 시간은 VisRAG 대비 약 20.76% 느리지만 ColPali보다는 18.24% 빠르며, 생성 단계는 두 방법보다 더 짧다(VisRAG 1.70×, ColPali 1.15×의 생성 시간 소요). [연구결과의 진행 상태 및 향후 계획] 현재 논문 버전은 이층 그래프·엣지 지연 상호작용·질의 분해를 갖춘 LILaC의 전체 파이프라인을 구현·평가했으며, 코드/데이터 산출물은 깃헙 저장소로 공개되어 재현성을 갖췄다. 아울러, 본 연구진은 라일락이 검색 과정에서 실시간으로 질의를 세분화하지 않고 사전에 고정된 정적 질의 분해(static query decomposition)를 사용하고 있으며, 지연 상호작용 또한 멀티홉 추론을 효과적으로 풀지 못하는 경우가 있는 것을 실험적으로 확인하였다. 이를 극복하기 위해 모달리티 간 단서를 단계적으로 추론하며 필요 시 질의를 재분해·재구성하는 동적 추론(dynamic reasoning) 기반의 멀티모달 검색 기법을 개발 중이다. [성과와 관련된 실적] Joohyung Yun, Doyup Lee, Wook-Shin Han. “LILaC: Late Interacting in Layered Component Graph for Open-domain Multimodal Multihop Retrieval,” EMNLP 2025 Main Conference [성과와 관련된 이미지] 그림 1. 기존 방법들이 멀티모달 데이터를 문서를 정확히 검색하지 못하는 사례를 보여주는 예시그림 2. LILaC 프레임워크의 전반적인 동작 과정
한욱신 교수 2025.09.03 1661 -
[한욱신 교수] TRIAL: Token Relations and Importance Aware Late-interaction for Accurate Text Retrieval
[연구의 필요성] Late-interaction 기반 다중 벡터 검색 시스템은 대규모 문서 검색에서 속도와 정확도를 크게 향상시켰으나, 토큰 레벨 유사도 점수를 단순 합산하는 방식으로 인해 두 가지 주요 한계가 발생한다. 첫째, 의미 단위(단어·구절)가 토큰화로 분리되어 독립적으로 매칭되면, 문맥상 무관한 문서가 높은 점수를 받을 수 있다(예: “Scott Derrickson”이 “scott”, “derrick”, “##son”으로 나뉘어 불필요한 매칭 발생). 둘째, 관사·전치사 같은 저내용 단어의 영향력을 무시하지 못해 관련성 추정이 부정확해진다. 기존 방법들(ColBERT, COIL 등)은 이러한 토큰 분리와 중요도 문제를 고려하지 않아, 특히 다중 토큰 엔티티나 기능어 중심 쿼리에서 검색 정확도가 제한된다. 이는 검색 엔진·질문응답 시스템 등에서 신뢰할 수 있는 결과를 제공하는 데 장애가 되며, 대형 언어 모델 기반 검색 증강 생성(RAG)에서도 관련 컨텍스트 공급의 질을 떨어뜨린다. [포스텍이 가진 고유의 기술] 본 연구진은 TRIAL(Token Relations and Importance Aware Late-interaction)이라는 새로운 Late-interaction 방식을 제안한다. 핵심은 토큰 관계와 중요도를 명시적으로 모델링하여 관련성 점수를 정밀하게 계산하는 것이다. (1) 토큰 관계 점수: 쿼리·문서 토큰 간 관계를 MLP 기반 Rel 함수로 인코딩하고, 도트 프로덕트로 유사도를 측정한다. 이를 통해 다중 토큰 엔티티(예: 명사구)를 일관된 의미 단위로 취급하며, 부분 매칭 노이즈를 줄인다(예: “Ed Wood” vs. “Robert Wood” 구분). (2) 토큰 중요도 가중치: 쿼리 토큰별 Gate 함수(Mish·ReLU 활성화 기반 2층 네트워크)를 통해 중요도를 예측하고, 관련성 점수에 가중한다. 이는 내용 중심 토큰(명사·형용사)을 강조하고 기능어(관사·보조동사)를 억제한다. 점수 함수는 기존 MaxSim에 관계 점수와 중요도 가중치를 통합하며, 훈련 시 KL 발산·교차 엔트로피 손실과 L1 정규화로 최적화한다. 검색 단계에서는 PLAID 알고리즘을 수정해 쿼리 중요도를 유사도 계산 과정에 반영한다. 요약하면, TRIAL은 ‘토큰 관계 인코딩 + 중요도 가중 메커니즘’으로 기존 Late interaction의 한계를 극복하며 정확성과 효율성을 동시에 달성한다. [연구의 의미] TRIAL은 MSMARCO(nDCG@10 46.3), BEIR(평균 nDCG@10 51.09), LoTTE Search(평균 Success@5 72.15) 벤치마크에서 SOTA를 달성하며, 희소·밀집 검색 방법들을 모두 능가했다. 특히 BEIR에서 SPLADE++ 대비 평균 0.39%p, ColBERTv2 대비 1.14%p 향상됐으며, LoTTE Search에서 ColBERTv2 대비 0.24%p 상승을 보였다. 이는 토큰 관계가 다중 토큰 구절의 의미적 의존성을 포착하고, 중요도 가중이 핵심 용어를 우선시한 효과로 해석된다. Ablation study에서 관계·중요도 제거 시 BEIR 평균이 각각 1.24%p·1.21%p 하락해 각 구성의 기여를 확인했다. 질적 분석에서도 부분 매칭 문서를 낮추고 금문서 순위를 높이는 효과가 뚜렷했다. 효율성 측면에서 쿼리 처리 시간은 ColBERTv2 대비 15.4% 증가(603ms vs. 523ms)에 그치며, 최대 200토큰 입력에서도 1200ms 이내 처리되어 대규모 검색 실용성을 유지한다. POS 태그 분석 결과, 내용 토큰(NOUN·ADJ) 점수가 0.8에서 최대 9.74로 증폭돼 정밀 관련성 추정이 가능해짐을 입증했다. [연구결과의 진행 상태 및 향후 계획] 현재 TRIAL은 MSMARCO 훈련 기반으로 세 벤치마크에서 평가를 완료했으며, 어블레이션·질적 분석을 통해 효과성을 검증했다. 코드와 데이터는 공개되어 재현성을 갖췄다. 그러나 관계 모델링으로 인한 계산 오버헤드, 영어 중심 평가, LoTTE Forum 같은 장문·비공식 쿼리에서의 상대적 약점 등이 한계로 확인됐다. 향후 계획으로는 다국어 확장(형태소 풍부 언어 지원)과 계산 최적화(병렬 GPU 활용 강화)를 통해 효율성을 높이고, 도메인 이동 문제를 해결하기 위해 포럼·장문 쿼리 적응 훈련이 있다. [성과와 관련된 실적] Hyukkyu Kang, Injung Kim, Wook-Shin Han. “TRIAL: Token Relations and Importance Aware Late-interaction for Accurate Text Retrieval,” EMNLP 2025 Main Conference. [성과와 관련된 이미지]
한욱신 교수 2025.09.03 1645 -
[김원화 교수] MNM: Multi-level Neuroimaging Meta-analysis with Hyperbolic Brain-Text Representations
[연구의 필요성] 뇌 영상 연구는 다양한 신경학적 현상을 밝히는 데 중요한 역할을 하지만, 개별 연구가 보통 소규모 피험자에 기반하기 때문에 통계적 신뢰성이 떨어지는 한계가 있습니다. 이를 보완하기 위해 여러 연구 결과를 통합하는 메타분석(meta-analysis)이 활용되지만, 기존 접근법은 주로 키워드 기반 검색이나 선형적 매핑에 의존하여 뇌의 위계적 구조를 충분히 반영하지 못했습니다. 그러나 실제 뇌는 큰 영역에서 세부 영역으로 점차 분화되는 위계적(hierarchical) 조직을 가지며, 이러한 특성을 고려하지 않으면 텍스트와 뇌 활성화의 정교한 연관성을 포착하기 어렵습니다. 따라서 뇌–텍스트 간 위계적 관계를 동시에 반영할 수 있는 새로운 분석 방법론이 필요합니다. [포스텍이 가진 고유의 기술] 본 연구의 차별성은 단순히 하이퍼볼릭 공간에 임베딩하는 데 그치지 않고, 뇌 영역 간 및 뇌 영역–기능 간 위계적 질서를 정밀하게 반영할 수 있도록 손실 함수를 설계한 것에 있습니다. 구체적으로, 1. 각도 기반 대조 학습(angle-based contrastive loss)을 통해 텍스트–뇌 활성화 쌍 간 의미적 대응성을 강화하면서 위계적 관계를 손상시키지 않도록 조율하였습니다. 2. 중심 정규화(centroid regularization)를 적용하여 뇌 활성화 임베딩이 텍스트 임베딩보다 상위 수준(보다 일반적 계층)에 위치하도록 하여, 뇌–텍스트 간 위계적 관계를 보존하였습니다. 3. 뇌 구조 위계 가이드(hierarchical loss)를 새롭게 제안하여 전역적 활성화(예: 반구 수준)와 국소적 활성화(예: 특정 ROI) 간의 구조적 서열을 올바르게 반영하도록 학습을 유도하였습니다. 이와 같은 손실 설계는 기존 연구들이 단순한 의미 정렬에만 집중했던 것과 달리, 신경영상 데이터의 다층적 구조와 기능적 위계를 동시에 반영할 수 있는 독창적인 접근법입니다. [연구의 의미] 본 연구는 뇌–텍스트 메타분석에서 단순한 임베딩 매칭을 넘어, 뇌 구조 및 기능의 위계적 질서를 학습 과정에 직접 반영하는 새로운 방법론을 제시하였습니다. 이를 통해: 뇌 영역의 전역–국소적 구조와 기능적 위계가 모델 내에서 명시적으로 고려되어, 기존 접근법보다 해석 가능성(interpretability)이 크게 향상되었습니다. 위계적 제약을 반영한 손실 설계를 통해 교차 모달 검색 및 뇌 활성화 예측에서 정확성과 일관성(consistency)을 동시에 확보할 수 있음을 실험적으로 입증했습니다. 뇌 기능 연구에서 중요한 다층적 인과 구조(coarse-to-fine hierarchy)를 자동적으로 재현할 수 있음을 보여주어, 향후 신경과학적 발견과 AI 기반 뇌 연구의 기반을 마련했습니다. 따라서 본 연구는 하이퍼볼릭 임베딩 위에서 위계적 손실을 정교하게 설계하여 신경영상 데이터의 다층적 구조를 실질적으로 반영한 최초의 메타분석 프레임워크라는 점에서 학문적·실용적 의의를 지닙니다. [연구결과의 진행 상태 및 향후 계획] 본 연구는 의료 인공지능 분야 최우수 국제학술대회인 International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2025)에서 조기 수락 논문(조기 수락률: 9%)으로 채택되었다. [성과와 관련된 실적] Seunghun Baek, Jaejin Lee, Jaeyoon Sim, Minjae Jung, Won Hwa Kim, “MNM: Multi-level Neuroimaging Meta-analysis with Hyperbolic Brain-Text Representations”, Medical Image Computing and Computer Assisted Intervention (MICCAI), 2025. [Provisional accept: ~9%] [성과와 관련된 이미지]
김원화 교수 2025.08.27 1744 -
[김원화 교수] Adaptive Adversarial Data Augmentation with Trajectory Constraint for Alzheimer’s Disease Conversion Prediction
[연구의 필요성] 알츠하이머 병이 발병되기 전의 전구 단계로서 경도인지장애(Mild Cognitive Impairment) 단계가 존재한다. 경도인지장애로 진단받은 환자가 3년 이내로 알츠하이머 병 단계로 악화가 될 경우 이를 진행형 경도인지장애(progressive MCI)라 하고, 반대로 알츠하이머로 진행이 되지 않는 경도인지장애 환자는 안정형 경도인지장애(stable MCI)라고 한다. 경도인지장애 환자들 중 실제로 알츠하이머로 전환되는 진행형 환자들을 식별하는 것이 알츠하이머 조기 진단 및 예방에 중요한 문제이다. 하지만 이러한 종적 신경퇴행성 질병의 데이터의 수는 적고, 특히 진행형 환자의 수는 안정형 환자들의 수보다 훨씬 적은 데이터 불균형(class imbalance)문제까지 있기 때문에, 인공지능 모델이 진행형 경도인지장애 환자와 안정형 경도인지장애 환자의 차이를 학습하는데 어려움이 존재한다. 따라서, 본 연구에서는 진행형 경도인지장애 환자의 뇌 데이터를 증강하고 이렇게 증강된 데이터를 기반으로 진행형과 안정형 경도인지장애를 구분할 수 있는 인공지능 모델을 개발하였다. [포스텍이 가진 고유의 기술] (1) 본 연구에서는 데이터 증강부터 알츠하이머병 발병 예측까지 두 가지 task를 end-to-end로 학습하는 새로운 인공지능 모델을 제시하였다. 즉, 데이터 수가 적은 진행형 경도인지장애 환자의 뇌 데이터를 증강하고, 이렇게 증강된 데이터와 실제 진행형/안정형 경도인지장애 환자들의 데이터를 기반으로 이 환자들이 3년 이내로 알츠하이머병으로 진행이 될지 여부를 구분하는 인공지능 모델을 개발하였다. (2) 경도인지장애 환자의 뇌 데이터를 그룹별(진행형/안정형), 환자별, 뇌 영역별로 나누어 각 단계별로 특징을 관찰, 이를 모델 학습에 반영하였다. 알츠하이머와 관련된 바이오마커를 그룹별로 비교했을 때, 일반적으로, 진행형 환자들이 안정형 환자들보다 알츠하이머 단계 환자들의 바이오마커 값과 유사하다. 따라서, 인공지능 모델이 특징공간(feature space)에서 안정형->진행형->알츠하이머 단계를 선형적 진행 경로로 배치 및 구분할 수 있도록 설계하였다. 진행형 경도인지장애 환자들을 개별적으로 관찰하였을 때, 경도인지장애 진단 후 1년 이내로 알츠하이머 병으로 전환되는 환자가 2년 뒤에 전환되는 환자보다 알츠하이머와 관련된 특징이 강했다. 또한, 진행형 경도인지장애 환자 그룹에서 뇌 영역별로 시간의 흐름에 따른 바이오마커 변화 양상이 다른 것을 관찰하였다. 이러한 환자별, 뇌 영역별 특징은 뇌 데이터 증강 시, 적대적 공격(adversarial attack)의 개념을 활용하여 모델 학습에 반영하였다. 구체적으로, 적대적 공격을 가한 데이터를 증강 데이터로 활용하였으며, 적대적 공격 시 공격의 횟수를 알츠하이머 병 전환 기간에 비례하도록 설정하여 특징 공간에서 환자별 차이를 고려하여 데이터 증강을 수행하였다. 또한, 적대적 공격의 강도는 학습 가능한 파라미터로 설계하였고, 이를 뇌의 각 국소 영역별로 다르게 학습되도록 구성하여 뇌의 영역별 차이를 고려하여 데이터 증강이 가능하다. (3) 증강된 진행형 경도인지장애 데이터가 실제 질병 진행 경로 상에 존재하도록 강제하는 경로 규제(trajectory constraint) 목적 함수를 고안하였다. 이를 통해 관측되지 않은 시점의 경도인지장애 뇌 데이터를 실제 데이터와 유사하게 생성할 수 있다. [연구의 의미] 데이터의 수가 적은 경도인지장애 환자의 뇌 데이터를 생성함으로써, 알츠하이머병 연구에 있어 데이터 부족 문제를 완화하고, 질병 진행 예측의 정밀도 향상에 기여하였다. 특히, 안정형과 진행형 경도인지장애 환자의 특성을 그룹별, 환자별, 뇌의 국소 영역별로 구분하고, 적대적 공격 기법을 사용하여 이러한 특징을 모두 고려한 데이터 증강 방법론을 고안하였다. 이를 통해 기존 연구들이 간과하기 쉬운 데이터의 단계별 특징을 포착할 수 있었다. 또한, 증강된 데이터가 실제 질병 진행 경로 상에 존재하도록 유도하는 경로 기반 제약(trajectory constraint)을 도입함으로써, 관측되지 않은 시점의 뇌 데이터를 생물학적으로 타당한 방식으로 생성할 수 있었다. 본 연구는 희귀하고 불균형한 임상 데이터를 보완하고 이를 기반으로 실제 알츠하이머 예측을 수행할 수 있는 인공지능 모델을 제시함으로써, 향후 알츠하이머 조기 진단 및 예후 예측 모델 개발에 활용 가능성을 제시한다. [연구결과의 진행 상태 및 향후 계획] 본 연구는 의료 인공지능 분야 최우수 국제학술대회인 International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2025)에서 조기 수락 논문(조기 수락률: 9%)으로 채택되었다. 향후 파킨슨병 등 타 퇴행성질환 데이터셋에 본 연구에서 제시한 인공지능 모델을 도입해 의료 분야에서 데이터 부족 문제를 완화하는데 기여할 수 있도록 후속 연구를 진행할 계획이다. [성과와 관련된 실적] Hyuna Cho, Hayoung Ahn, Guorong Wu, Won Hwa Kim, “Adaptive Adversarial Data Augmentation with Trajectory Constraint for Alzheimer’s Disease Conversion Prediction”, Medical Image Computing and Computer Assisted Intervention (MICCAI), 2025. [Provisional accept: ~9%] [성과와 관련된 이미지]
김원화 교수 2025.08.27 1576



