본 기술은 인간형 로봇의 비전 정보를 활용하여 사용자가 파지한 물체(테이블)의 기울기를 상태 이미지로부터 추정하고, 강화학습(DQN) 모델을 통해 최적의 균형 맞춤 동작을 결정 및 수행합니다. 이때, 사용자 얼굴 표정을 실시간으로 분석하여 얻은 감성 기반 표정 피드백 값을 환경 보상 값과 함께 강화학습 모델에 반영함으로써 학습 효율을 높이는 메커니즘을 가집니다.
기존의 리워드 쉐이핑 방식은 사람이 별도의 입력 장치를 통해 수동으로 피드백을 제공해야 하는 번거로움이 있고, 피드백 유형이 제한적이며, 에이전트 모델링 과정에서 고도의 전문 공학 지식이 요구되어 자연스러운 로봇 학습 환경 구현에 한계가 있습니다.
본 기술은 사용자의 얼굴 이미지를 촬영하여 표정 평가 모델을 통해 감성을 2차원 감성 공간에 매핑하고, 이를 기반으로 자동화된 표정 피드백 값을 생성합니다. 이 피드백 값을 사전 설정된 가중치를 거쳐 환경 보상 값과 합산한 후, DQN 모델의 Q 함수 오차를 최소화하도록 파라미터를 업데이트하는 인터액티브 딥강화학습 구조를 제안합니다.
N/A