저조도·비·안개·흔들림 등 다양한 환경 변화에서도 일관되고 안전하게 시각적 도움을 받을 수는 없을까?
•
멀티모달 AI의 발전으로 시각장애인 보조 시스템 활용 가능성이 급격히 커지고 있으나, 실험실 외 실세계 환경에서의 신뢰성 확보가 과제임
•
비·안개·야간·역광 등 환경 변화 시 도메인 변화(Domain Shift) 현상으로 시각 인식 성능이 크게 저하되며, 계단·차량 오인식은 시각장애인의 생명·안전에 직접적 위협이 됨
•
기존 Test-time Adaptation(TTA) 방법은 실시간 처리 지연, 모델 붕괴, 특정 아키텍처 종속성이라는 세 가지 본질적 한계를 가짐
기존 방식의 문제점
•
기존 TTA 방법은 추론 시마다 모델 파라미터를 업데이트해 실시간 처리가 불가능함
•
초기 오인식이 반복 학습되면서 성능이 완전히 붕괴되는 오류 누적 문제가 발생함
•
기존 TTA 방법 대부분이 특정 모델 구조에 종속되어 다양한 모델에 대한 적용이 제한됨
핵심 아이디어
•
GITA (Gamma-based Input Test-time Adaptation): 탐지기 파라미터를 완전히 동결한 채 학습 가능한 파라미터를 스칼라 감마(γ) 하나로 한정하고, 입력 이미지만 변환하여 도메인 간 분포 불일치를 보정하는 입력 공간 기반 Continual TTA 방법론 설계
•
입력 변환 모듈: RGB 채널별 히스토그램 스트레칭 → Gamma Correction → 원본과 MixUp 합성으로 의미 정보를 보존하면서 외관만 타겟 도메인에 적응시킴
•
특징 통계 정렬 모듈: 동결된 백본 앞단 정규화 레이어에서 타겟 도메인 통계량을 추출하고, 소스 도메인 통계량과의 KL divergence를 최소화하는 방향으로 γ만 업데이트 → 모델 붕괴·오류 누적 원천 차단
•
안경형 웨어러블 비전 어시스턴트: GITA + Qwen3-Omni 멀티모달 AI를 결합, ESP32 기반 안경형 하드웨어에서 버튼 모드(물체 질의·OCR·상황 안내)와 실시간 경보 모드(계단·차량·사람 자동 감지)를 지원하는 End-to-End 시스템 구현
활용된 핵심 기술 또는 이론
•
Test-time Adaptation (TTA), Gamma Correction, Histogram Stretching, MixUp, KL Divergence 기반 특징 통계 정렬, 객체 탐지 (Faster R-CNN, RT-DETR, YOLO11)
•
멀티모달 대형 언어 모델 (Qwen3-Omni), WebSocket 기반 임베디드-서버 분산 시스템 설계, ESP32 임베디드 프로그래밍, 3D CAD 모델링 및 프린팅
기존 방식과의 차별성
•
탐지기 전체를 동결하고 스칼라 γ 하나만 업데이트하여, 기존 TTA 대비 역전파 비용을 수십 배 경량화하고 모델 붕괴를 구조적으로 차단
•
백본 모델 구조와 상관 없이 적용 가능 (Model-Agnostic 설계)
문제 해결 과정
•
KL divergence 실증 실험으로 도메인 변화의 본질 확인 → GITA 알고리즘 설계 및 벤치마크 구현 (SHIFT, CityScapes-C)
•
3D CAD 모델링·프린팅, ESP32 WebSocket 클라이언트, AI 서버(Qwen3-Omni + TTAService) 구축
•
버튼 모드·실시간 경보 모드 통합, 소프트웨어 웹 클라이언트 구현, 실제 저시력 사용자 대상 검증 및 피드백 반영
최종 사용자
•
시각장애인 및 저시력자 - 일상 이동 환경에서 AI를 눈처럼 사용하는 직접 수혜자
•
시각장애인 복지 기관 및 보조공학 서비스 제공자 - 기존 보조 기술의 날씨 의존성 한계를 보완하는 솔루션으로 활용
기대효과
•
날씨·조명 변화와 무관하게 안정적인 주변 정보 인식으로 시각장애인의 안전한 독립 보행과 자립적 일상생활 직접 지원
•
소프트웨어 클라이언트 동시 제공으로 하드웨어 보급 격차를 우회, 더 많은 시각장애인이 즉시 혜택을 누리는 접근성 확보
참여 정보
팀명
GITA
수강 교과목
종합설계1
지도 교수
김영국
참여 개발자
문채운(인공지능학과), 이유민(인공지능학과)



