일반기술
문서 인식 장치의 개별 문자 절출 방법
본 기술은문서인식장치에 있어서의 개별문자 절출에 관한 것으로, 좀더 상세하게는 한글이나 한자, 영자 및 부호/숫자 등이 혼용되어 있는 문서(이하, "종합문서"라 한다)를 인식하기 위한 문서인식장치의 개별문자 절출방법에 관한 것이다.문자열에서 수직흑화소수에 의하여 각 개별문자를 분리하고 각 개별문자의 평균폭과 스페이스의 평균 피치를 이용하여 물리적으로 인접 문자를 합하거나 절단하는 종래의 방법은 순수 한글만 있을때만 가능하다. 일예를들면 "11과"라는 문자열에 대해서는 11이 합쳐진 하나의 문자로 되게 된다. 또한 많은 문자가 접촉되어 있는 경우 문자의 평균 피치가 커져 이들 접촉 문자가 정피치 문자로 분류되어 인접한 두 한글이 융합되는 치명적인 경우가 생길 수 있으며 한글 문서가 순수하게 한글만으로 구성되는 경우는 없고 적어도 부호/숫자를 포함하고 있으며 영자나 한자를 포함하는 경우도 다수있다.본 기술은 문자열의 높이 정보를 이용하므로 접촉문자가 많이 있는 경우에도 이들이 접촉되어 있다는 것을 문자열의 높이 정보를 이용하여 알 수 있어 접촉문자를 정확하게 절취할 수 있는 뛰어난 효과가 있고, 문자종류에 관계없이 문서를 인식할 수 있게 함으로써 문서인식 장치개발의 실효성을 높이는 효과가 있다.입력문서로 부터 2치 화상데이타를 발생시키는 스캔단계과, 입력화상으로 부터 그림영역과 문자영역을 분리하고 문자영역에 대하여 문자열을 추출하는 영역분할 및 문자열 추출단계와, 추출된 문자열 정보를 메모리에서 읽어내어 개별문자를 절출하는 개별문자 절출단계와, 절출된 개별문자로부터 각각의 문자 종류에 따라 인식을 행하는 인식단계와, 인식결과를 이용하여 잘못인식된 부분을 수정하여주는 후처리 단계와, 이를 포함하여 이루어진것을 특징으로 한다.
기술정보
- 기술분류
- 기계 > 기타 기계
- 보유기관
- 한국산업기술진흥원
- 기술유형
- 일반기술
- 등록일
- 2007-07-31
- 데이터 갱신일
- 정보 없음
상세설명
정보 없음
관련 특허
등록된 관련 특허가 없습니다.