일반기술
웹 문서 콘텐츠 분류 및 필터링 기술
해당 기술은 웹 문서 콘텐츠를 분석하여 기 정의된 범주로 자동으로 분류하고, 성인/도박 등의 스팸 문서 및 중복 문서를 필터링 하여 정제하는 기술에 대한 것이다. 웹에는 수십억 개의 웹 페이지가 있다고 알려져 있는데 이러한 웹 페이지로부터 일반 사용자들이 원하는 유용한 정보를 찾기 위해서 포털 등에서 웹 페이지 검색 기능을 제공한다. 웹 페이지의 많은 부분은 웹 2.0 시대에 맞게 일반 사용자들이 콘텐츠를 작성하는 ‘1인 미디어’ 블로그가 상당수를 차지하고 인터넷의 발전 경향에서도 블로그가 차지하는 비중은 더욱더 증가할 전망이다. 블로그는 블로그를 운영/관리하는 블로거의 성향을 반영하여 주로 특정 분야에 대한 전문적인 지식을 다루게 되기 때문에 일반적인 웹 검색으로 접근하는 것은 한계가 있다. 그러므로 전문지식에 대한 사용자 요구사항을 만족시킬 수 있는 시스템 및 기술이 필요하다. 본 연구팀에서는 Conditional Random Fields 및 Support Vector Machine 등의 최신 기계 학습 방법을 이용하여 사용자 질문 및 전문 웹 페이지를 특정 분류 체계에 맞게 자동 분류하고, 중복 여부를 검사하여 필터링하며 성인이나 도박과 같은 내용을 담은 스팸문서를 제거하여 시스템이 저질 문서를 처리하는 비용을 차단하고자 한다. 현재는 현재는 계층 구조의 키워드 정보만을 이용하거나 블로거가 등록한 태그 정보만을 이용하여 분류하기 때문에 자동 분류 성능이 사용자의 요구를 만족치 못 한다. 또한 중복 여부를 확인할 수 있는 기술이 없어 같은 내용의 문서를 여러 번 중복 저장하는 비효율적인 색인방식을 채택하는 점을 보완하여 웹 문서 콘텐츠 서비스 관련 기술들을 산업화에 활용하고자 한다. <활용방안 및 기대성과> 해당 기술에 포함된 자동 분류기는 웹 문서 콘텐츠를 내용을 분석해 기정의된 범주 체계로 할당함으로써 효과적인 정보 관리에 용이하며 최종 웹 문서 콘텐츠 제공 관련 서비스(예를 들면, 검색 서비스)의 질을 향상시킬 수 있다. 또한 정보검색의 성능에 악영향을 미치는 스팸 콘텐츠 및 내용이 중복된 중복 콘텐츠를 필터링 하는 기술은 정보 저장 측면 뿐 아니라 양질의 콘텐츠를 관리가 용이하게 한다.
기술정보
- 기술분류
- 통신 > 기타 통신
- 보유기관
- 한국전자통신연구원
- 기술유형
- 일반기술
- 등록일
- 2009-01-15
- 데이터 갱신일
- 정보 없음
상세설명
정보 없음
관련 특허
등록된 관련 특허가 없습니다.