일반기술

웹 정보 추출 방법 및 시스템

본 기술은 웹 브라우저에 의해 검색된 웹 사이트들중에서 원하는 정보를 가지고 있는 하나의 타겟 URL(Uniform Resource Location)에 하이퍼 링크된 복수의 URL에 저장된 문서를 내용기반하여 추출하는 방법에 있어서, (a) 깊이우선탐색을 이용하여 상기 선택된 타겟 URL에 하이퍼 링크된 하위 계층 URL을 탐색하는 단계; (b) 상기 타겟 URL과 탐색된 URL로부터 원하는 정보를 부분적으로 추출하는 단계; (c) 상기 부분적으로 추출된 정보를 하나의 문서로서 저장하는 단계; (d) 기설정된 탐색깊이에 도달할 때 까지 상기 단계를 반복하는 단계를 포함하는 것을 특징으로 하는 웹 정보 추출 방법에 관한 것이다.본 기술은 클라이언트와 자바 에이전트를 갖는 서버가 연결된 네트워크상에서 내용기반한 웹 정보 추출 방법 및 시스템에 관한 것이다. 본 발명은 먼저 클라이언트에서 사용자 인터페이스 윈도우를 통하여 타겟 URL과 키워드 및 탐색깊이정보를 서버로 제공한다. 이에 따라, 서버에서는 깊이우선탐색을 이용하여 상기 타겟 URL에 링크된 하위 계층 URL을 탐색깊이까지 탐색하고, 탐색된 URL로부터 상기 키워드에 대응하는 정보를 부분적으로 추출하여 상기 추출된 정보를 하나의 파일로 수집한다. 이렇게 수집된 파일은 상기 클라이언트에서 웹 브라우져를 이용하여 브라우징할 수 있다.; 따라서, 본 기술은 기존의 URL 검색 엔진의 내용검색 확장 기능으로 사용될 수도 있으며, 독자적인 에이전트 서비스로서 신속 간편한 내용 검색과 정보요약추출을 원하는 사용자들에게 제공될 수도 있다.

기술정보

기술분류
정보 > 컨텐츠 처리·출력 기술
보유기관
한국과학기술원
기술유형
일반기술
등록일
2006-06-12
데이터 갱신일
정보 없음

상세설명

정보 없음

관련 특허

등록된 관련 특허가 없습니다.