최신연구
[박상돈 교수] Online Conformal Prediction with Adversarial Semi-bandit Feedback via Regret Minimization
- 등록일2026.07.16
- 조회수75
-

교수박상돈
[연구의 필요성]
최근 AI 시스템은 데이터 분포가 지속적으로 변화하는 온라인 환경에서 활용되는 경우가 증가하고 있다. 이러한 환경에서는 모델의 예측뿐만 아니라 예측의 신뢰도를 함께 제공하는 것이 중요하다. 기존 Conformal Prediction 기법은 전체 정답 피드백 또는 고정된 calibration 데이터를 필요로 하기 때문에 실제 온라인 환경에 적용하기 어렵다. 따라서 제한적인 피드백만을 활용하면서도 예측 신뢰도를 보장할 수 있는 새로운 Online Conformal Prediction 기술이 요구된다.
[포스텍이 가진 고유의 기술]
본 연구에서는 Online Conformal Prediction 문제를 regret minimization 관점에서 새롭게 정식화하고, adversarial semi-bandit feedback만을 이용하여 conformal threshold를 온라인으로 학습하는 OCP-Unlock+ 알고리즘을 개발하였다.
핵심 기술은 다음과 같다.
Adversarial semi-bandit feedback 기반 Online Conformal Prediction
Regret minimization 기반 threshold 업데이트
부분 피드백만으로도 coverage를 유지하는 온라인 학습 알고리즘
다양한 분류 및 회귀 문제에 적용 가능한 일반적인 프레임워크
[연구의 의미]
본 연구는 제한적인 피드백만 주어지는 현실적인 온라인 환경에서도 예측 신뢰도를 보장할 수 있는 Online Conformal Prediction 방법을 제시하였다. 이를 통해 기존 Conformal Prediction의 적용 범위를 크게 확장하였으며, 의료 AI, 자율주행, 추천 시스템, 대규모 AI 서비스 등 신뢰성이 중요한 다양한 응용 분야에 활용될 수 있는 기반 기술을 마련하였다.
[연구결과의 진행 상태 및 향후 계획]
현재 알고리즘 개발과 성능 검증을 완료하였으며, ICLR 2026에 논문이 게재되었다.
향후에는 다음과 같은 연구를 진행할 계획이다.
대규모 언어모델(LLM)의 불확실성 추정으로 확장
Selective Prediction 및 AI Safety 문제와의 결합
더욱 일반적인 부분 피드백 환경에 대한 이론적 보장 확장
실제 온라인 AI 시스템에서의 적용 및 실증
[성과와 관련된 실적]
ICLR 2026 논문 게재
논문명: Online Conformal Prediction with Adversarial Semi-bandit Feedback via Regret Minimization
온라인 Conformal Prediction 분야의 새로운 regret minimization 기반 프레임워크 제안
ImageNet, Airfoil 등 다양한 데이터셋에서 기존 방법 대비 우수한 성능 검증
[기대효과 및 활용 분야]
신뢰성 있는 온라인 AI 시스템 구축
의료 AI 및 자율주행 등 안전성이 중요한 분야 적용
실시간 예측 시스템의 불확실성 관리
대규모 언어모델 기반 AI 서비스의 신뢰도 향상
Online Learning 및 AI Safety 연구로의 확장
[기술의 차별성]
기존 Online Conformal Prediction 방법은 전체 피드백을 요구하거나 제한적인 온라인 환경만을 고려하였다. 본 연구는 adversarial semi-bandit feedback 환경을 고려하여 부분 피드백만으로도 목표 coverage를 유지하도록 설계되었으며, regret minimization 기반 학습을 통해 변화하는 환경에서도 안정적으로 threshold를 조정할 수 있다는 점에서 차별성을 가진다.
[성과와 관련된 이미지]
OCP-Unlock은 예측 결과에 따라 관측 가능한 정보만을 활용하여 conformal threshold를 온라인으로 갱신한다. 예측 집합이 정답을 포함한 경우에는 실제 레이블을 이용해 모든 관련 threshold를 업데이트(Full Unlocking)하고, 정답을 포함하지 못한 경우에는 관측 가능한 threshold만 선택적으로 업데이트(Partial Unlocking)한다. 이를 통해 제한적인 semi-bandit feedback 환경에서도 목표 coverage를 유지하며 효율적인 prediction set을 생성할 수 있다.



