일반기술

설명문 추출방법

본 기술은 문서인식에 관한 것으로, 특히 텍스트영역으로 부터 설명문영역을 구분해내는데 적당하도록 한 설명문 추출방법에 관한 것이다.일반적인 문서 인식방법에 있어서는 그림이나 사진영역 하단에 기록된 설명문 (caption)을 텍스트와 구분시키지 않아 동일한 알고리즘으로 문서인식을 수행할 경우 설명문은 보통 고딕체인 반면 텍스트는 명조체로 되어 있고, 즉, 문자체가 서로 다르고, 문자의 크기도 서로달라 인식상의 에러가 발생 될 뿐더러 그에따른 인식시간이 많이 소요되는 문제점이 있었다.본 기술은 문제점을 해결하기 위하여 그림이나 사진영역의 하단에 기록된 설명문을 텍스트와 별도로 설명하고,본 기술에서 설명문 추출후 그 설명문의 주(parent)영역과 종(child)영역의 추출순서를 보인 설명도이며, 상,하로 인접한 영역간에서 설명문의 추출을 설명하기 위해 보인 본 기술의 설명문 추출방법에 대한 신호 흐름도로서 이들을 참조하여 본 기술을 설명한다.설명문 추출순서는 블록의 영역(class) 판별주→주설명추출→종설명문추출 순서로 진행되는 것으로써 먼저, 문서상에 존재하는 모든 블록에 대해 순차적으로 그 영역의 종류를 조사하면서 그 영역이 그림 또는 사진영역에 해당될때 설명문 추출을 시도한다.

기술정보

기술분류
정보 > 기타 정보
보유기관
한국산업기술진흥원
기술유형
일반기술
등록일
2008-01-02
데이터 갱신일
정보 없음

상세설명

정보 없음

관련 특허

등록된 관련 특허가 없습니다.