일반기술
한국어 블로그 자동분류 기술
블로그의 포스트를 분석하여 기정의된 다중 범주로 자동 분류해 주는 기술 해당 기술은 다음과 같은 기술적 특징을 갖는다. 첫째, 블로그 포스트의 제목, 태그, 사용자 범주, 포스트 본문 등의 다양한 정보를 이용하고 차후 필요한 정보는 추가 및 weighting을 지정하여 적용하고자 하는 분야에서 최적의 성능을 보인다. 둘째, 최신 기계 학습 모델(Conditional Random Fields 및 Support Vector Machine)을 이용하여 한국어 블로그의 포스트 자동 분류를 수행함으로써 높은 성능을 보여준다. 셋째, 기존의 평면적 계층 구조에 분류하는 것과 다르게 다중( multi label) 범주에 대해서 자동 분류를 수행한다. 넷째, 고성능의 한국어 형태소 분석 기술을 이용하여 블로그의 포스트에 대한 높은 수준의 분석 정보를 이용한다.웹에는 수십억개의 웹 페이지가 있다고 알려져 있는데 이러한 웹 페이지의 많은 부분은 웹 2.0 시대에 맞게 일반 사용자들이 콘텐츠를 작성하는 ‘1인 미디어’ 블로그가 상당수를 차지하고 인터넷의 발전 경향에서도 블로그가 차지하는 비중은 더욱더 증가할 전망이다. 블로그는 블로그를 운영/관리하는 블로거의 성향을 반영하여 주로 특정 분야에 대한 전문적인 지식을 다루게 되기 때문에 일반적인 웹 검색으로 접근하는 것은 한계가 있다. 블로그는 다수의 포스트로 구성이 되는데 이러한 포스트를 분석하면 블로그를 관리하는 블로거가 어떤 분야에 관심이 있는지를 알 수 있고 일반 웹 사용자가 관심있는 분야와 일치한다면 이러한 블로그를 주기적으로 방문하여 원하는 정보 및 지식에 쉽게 접근할 수 있다. 본 연구팀에서는 Conditional Random Fields 및 Support Vector Machine 등의 최신 기계 학습 방법을 이용하여 블로그의 포스트를 특정한 분류 체계에 맞게 자동 분류하고자 한다. 현재는 계층 구조의 키워드 정보만을 이용하거나 블로거가 등록한 태그 정보만을 이용하여 분류하기 때문에 자동 분류 성능이 사용자의 요구를 만족치 못 한다. 좋은 성능의 블로그 자동분류 기술을 업체에 이전함으로써 블로그 관련 기술들을 산업화에 활용하고자 한다.<활용방안 및 기대성과>-블로그 포스트 자동 분류에 활용 -입력된 문서에 맞는 광고 분류 인식에 활용 -한국어 관련 분야 특허를 이용한 트렌드 마이닝의 기초 기술로 활용
기술정보
- 기술분류
- 통신 > 기타 통신
- 보유기관
- 한국전자통신연구원
- 기술유형
- 일반기술
- 등록일
- 2009-01-22
- 데이터 갱신일
- 정보 없음
상세설명
정보 없음
관련 특허
등록된 관련 특허가 없습니다.