일반기술
강화학습을 이용한 자율이동로봇의 행동계획
강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.
기술정보
- 기술분류
- 정보 > 기타 정보
- 보유기관
- (재)송도테크노파크
- 기술유형
- 일반기술
- 등록일
- 2005-08-08
- 데이터 갱신일
- 정보 없음
상세설명
정보 없음
관련 특허
등록된 관련 특허가 없습니다.