본 기술은 오프라인 강화 학습 모델을 사용하여 비정형 물체의 파지 자세를 도출합니다. 로봇 작업 환경 내 수집된 오프라인 데이터에서 작업 영역을 추출하고, 오프라인 유효 데이터에 존재하지 않는 행동 중 Q-값이 높은 행동에 패널티를 부여하여 오프라인 데이터의 분포를 벗어난 과도한 Q-값 예측을 방지하고 파지 성공률을 최적화합니다.
실시간 온라인 강화 학습 방식은 데이터 수집 과정에서 로봇 손상 위험이 높고, 많은 시간과 비용이 소요되며 실제 현장 적용 시 환경적 제약으로 인해 구현이 어려운 문제가 있습니다.
본 기술은 오프라인 강화 학습 기반 모델을 적용하여 실시간 상호작용 없이 학습을 수행합니다. 픽셀별 Q-값을 추론하고, 기존 데이터셋(오프라인 유효 데이터)에 포함되지 않은 행동 중 Q-값이 최대인 경우 해당 행동에 패널티를 부여함으로써, 모델이 학습 데이터 분포를 벗어난 잘못된 최적 행동을 선택하는 것을 방지하고 6 자유도 파지 자세를 정밀하게 도출합니다. 물류 피킹과 서비스 로봇, 제조 자동화에 적용될 수 있어 데이터 수집 중 로봇 손상 없이 파지 성공률을 최적화합니다.
본 발명은 과학기술정보통신부의 인공지능융합혁신인재양성 지원을 통해 개발되었습니다.
N/A