일반기술
한국어 품사 태깅 시스템/한국어 형태소 분석기/한국어 색인기/로마자 변환기
1. 기술의 개요형태소 분석기는 일반 단어 322,212건, 다수어절 109,635건, 오용 단어 120,336건을 포함한 형태소 사전을 이용하여 형태소 분석을 한다. 오류가 없는 문서에 대해서는 99% 이상의 형태소 분석 정확도를 보인다.품사 태깅 시스템은 품사 중의성 해소 방법으로 규칙이나 확률 혹은 이 둘을 모두 사용할 수 있게 구성하였다. 규칙으로는 일반규칙과 특수규칙으로 구성되며, 형태소 분석 후보 또는 주위 다른 어절 후보와의 사이에 정수 형태의 긍정/부정/절대부정 가중치를 부여할 수 있다. 정확도는 교과서와 신문자료에서 각각 97.6%, 98.1%였다.또, 중의성 해소를 위해 독자적으로 개발한 어절확률추정모델을 사용하여 구한다. 형태소 빈도(uni-gram)와 어절 내 범주 패턴 가중치(simulated annealing으로 학습)를 이용하여 구한 어절 확률과, 앞 어절 마지막과 뒤 어절 첫 형태소(명사화된 것은 마지막 형태소) 간 범주 bi-gram을 사용한 전이확률을 적용했다. 정확도는 세종말뭉치에서 97.2%였다.한국어 색인기는 다수 어절의 고유 명사에 대한 형태소 분석과 태깅의 결과를 활용하여 구현하였고, 정확도는 신문자료에 대하여 97%이다.로마자 변환기는 문화관광부고시 제2000-8호를 따르게 하였다.2. 기술의 특징빈번한 맞춤법 오류를 분석한 정보를 형태소 분석용 사전 자체에 포함하고 있어 비속어나 은어 등 잘못된 표현이 다수 포함된 인터넷 문서에서의 형태소 분석 성공률을 높였다. 띄어쓰기 오류, 외래어 표기법 오류, 오용어를 포함한 문서의 형태소 분석이 가능하며 교정 정보도 제공한다. ‘오사마 빈 라덴’ 같은 다수 어절로 구성된 단어도 분석할 수 있다. 품사 중의성 해소에 사용하는 규칙은, 컴퓨터 비전문가도 규칙을 쉽게 추가 수정하여 결과를 바로 확인할 수 있도록 시스템의 코드 부분와 분리하였다. 따라서 언어전문가가 직접 규칙의 유지 관리가 가능하고, 특정 분야에 최적화시키기도 쉽다.확률을 이용한 중의성 해소 모델은 97.2%의 높은 정확도를 가지지만 메모리 사용량은 형태소(uni-gram)를 사용할 때보다 1.3% 정도 많다. 그러나 형태소 bi-gram을 사용할 때의 약 10% 수준이다. 이는 국내 다른 연구 결과에서 형태소 tri-gram을 사용한 성능이 96.97%인 것과 비교해 고무적인 성능이다. 또한, 규칙과 확률을 함께 혹은 따로 적용할 수 있어서 응용 시스템의 필요에 맞게 조절할 수 있다.
기술정보
- 기술분류
- 정보 > 기타 소프트웨어
- 보유기관
- 한국과학재단
- 기술유형
- 일반기술
- 등록일
- 2008-06-24
- 데이터 갱신일
- 정보 없음
상세설명
정보 없음
관련 특허
등록된 관련 특허가 없습니다.