일반기술

음절단위 조건확률을 이용한 한국어 자동 띄어쓰기 방법

본 발명은 컴퓨터를 사용하여 한국어 텍스트를 처리하는 정보처리 기술 분야에서 한글로 이루어진 문장의 띄어쓰기를 자동으로 처리하기 위한 것이다. 종래에는 음절간 상호정보를 이용하여 자동 띄어쓰기를 한 예가 있으나 형태소 분석을 필요로 하므로 상당한 어휘지식과 휴리스틱이 필요하며 정확도도 낮다. 본 발명에서는 어휘 지식이나 휴리스틱을 사용하지 않고 통계적인 방법을 사용하여 띄어쓰기가 잘못된 임의의 길이의 문장을 바르게 고칠 수 있으며 아울러 띄어쓰기 정확도를 향상시키며, 띄어쓰기가 일부 되어 있는 문장 또는 전혀 공백이 없는 문장에 대해서도 동작하도록 한다. 제시된 방법에서는 다른 상태로의 천이시에는 음절이 발생하고 같은 상태로의 천이시에는 공백이 발생하는 마코프 문장 발생 모델을 가정하고, 가능한 모든 띄어쓰기 패턴 중에서 음절 조건확률과 단어 길이의 확률분포를 이용하고 입력 음절갯수로 정규화된 문장 로그 확률이 최대가 되는 패턴을 찾는다. 디코딩 과정에서 사용되는 격자노드에는 이전까지의 음절정보, 누적 로그확률, back pointer 등을 저장한다. 최적의 스트링을 빠르게 찾기 위하여 상태천이의 제한 조건을 이용하고 빔 탐색 기법을 사용한다. 음절 조건확률을 통계 데이터로부터 구할 수 없는 경우에는 백오프 기법을 사용하여 계산한다.한국어 자동 띄어쓰기 방법에 있어서, 띄어쓰기 최적 패턴 탐색을 위한 가설을 설정하는 제 1단계; 상기 설정된 가설에 의거하여 최대 누적 로그 확률을 계산하는 제 2단계; 및 상기 최대 누적 로그 확률 및 백 포인터를 이용하여 입력된 음절의 띄어쓰기 최적패턴을 탐색하여 출력 스트링을 획득하는 제 3단계 를 포함하는 음절단위 조건확률을 이용한 한국어 자동 띄어쓰기 방법

기술정보

기술분류
정보 > 인공지능
보유기관
한국전자통신연구원
기술유형
일반기술
등록일
2002-07-10
데이터 갱신일
정보 없음

상세설명

정보 없음

관련 특허

등록된 관련 특허가 없습니다.