일반기술

강화학습을 이용한 자율이동로봇의 행동계획

강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.강화학습은 온-라인 학습법으로서 Suutton's TD방법에 의한 actor-critic architecture 와 watkin's Q-learning 이 대표적인데 동적으로 변화하는 환경하에서 컨트롤러 또는 에이젼트의 행동에 대한 보상을 최대화하는 상태-행동 규칙이나 행동발생전략을 찾는 것이다.

기술정보

기술분류
정보 > 기타 정보
보유기관
(재)송도테크노파크
기술유형
일반기술
등록일
2005-08-08
데이터 갱신일
정보 없음

상세설명

정보 없음

관련 특허

등록된 관련 특허가 없습니다.