IBM Cloud Object Storage

IBM Cloud® Object Storage 데이터 소스에 저장된 문서를 크롤링합니다.

IBM Cloud IBM Cloud 오직

이 정보는 관리 배치에만 적용됩니다.

크롤링되는 문서

컨텐츠의 초기 크롤링 중에 스토리지 엔드포인트에서 액세스할 수 있는 모든 컨텐츠의 문서가 크롤링되어 콜렉션에 추가됩니다. 개인 엔드포인트는 크롤링할 수 없습니다.

후속 스케줄된 리크롤링 중에는 새 문서 및 수정된 문서만 크롤링되고 변경사항이 콜렉션에 반영됩니다. 외부 데이터 소스에서 삭제된 문서는 콜렉션에서 삭제되지 않습니다.

모든 Discovery 데이터 소스 커넥터는 읽기 전용입니다. 크롤링 계정에 부여된 권한에 관계없이 Discovery 는 원래 데이터 소스의 컨텐츠를 쓰거나 업데이트하거나 삭제하지 않습니다.

다음 표는 Discovery 가 크롤링할 수 있는 오브젝트를 보여줍니다.

데이터 원본 크롤링 지원
데이터 소스 크롤링되는 오브젝트
IBM Cloud Object Storage 버켓, 파일

시작하기 전에 필요한 사항

연결하려는 웹 사이트의 컨텐츠에 대한 필수 서비스 라이센스를 확보하십시오. 라이센스에 대한 자세한 정보는 데이터 소스의 시스템 관리자에게 문의하십시오.

엔드포인트

IBM Cloud Object Storage 데이터의 endpoint 입니다. 예를 들어, s3.us-south.cloud-object-storage.appdomain.cloud입니다.

http://https:// 를 엔드포인트 값에 포함시키지 마십시오. 자세한 정보는 지역 엔드포인트를 참조하십시오.

엔드포인트 외에도 오브젝트 저장소에 대한 인증을 사용으로 설정하기 위한 신임 정보를 제공해야 합니다. 다음 인증 방법 중 하나를 사용하도록 선택할 수 있습니다.

HMAC
해시 기반 메시지 인증 코드를 사용하여 사용자를 인증합니다. HMAC는 해시 함수 및 비밀 키를 사용하는 암호화 인증 기술입니다. 데이터는 인터넷을 통해 전송되기 전에 스크램블됩니다. 그런 다음 의도된 수신인은 비밀 키를 사용하여 데이터를 스크램블 해제합니다. 자세한 정보는 HMAC 인증 을 참조하십시오.
IAM
(IAM IBM Cloud Identity and Access Management 서비스를 사용하여 사용자를 인증합니다. 이 인증 유형의 장점은 사용자가 동일한 프로세스를 사용하여 IBM Cloud Platform의 모든 리소스에 액세스할 수 있다는 것입니다. 자세한 정보는 IAM 인증 을 참조하십시오.

인증 정보에 액세스하려면 IBM Cloud Object Storage 서비스 인스턴스의 서비스 인증 정보 페이지로 이동하십시오. 신임 정보 세부사항을 보려면 서비스 신임 정보를 펼치십시오.

자세한 정보는 Object Storage 제품 문서에서 서비스 신임 정보 를 참조하십시오.

HMAC 인증

HMAC 인증을 사용하려면 다음 정보가 준비되어 있어야 합니다.

액세스 키 ID
IBM Cloud Object Storage 인스턴스가 작성될 때 생성된 access_key_id 입니다. 예를 들어, 347aa3a4b34344f8bc7c7cccdf856e4c입니다.
시크릿 액세스 키
요청에 서명하는 데 사용할 secret_access_key 입니다. 이 키는 IBM Cloud Object Storage 인스턴스가 작성될 때 생성되었습니다. 예를 들어, gvurfb82712ad14W7a7915h763a6i87155d30a1234364f61입니다.

API 인증

IAM 인증을 사용하려면 다음 정보가 준비되어 있어야 합니다.

IAM API 키
예를 들어, 다음과 같습니다. 0viPHOY7LbLNa9eLftrtHPpTjoGv6hbLD1QalRXikliJ
자원 인스턴스 ID
예를 들어, 다음과 같습니다. cloud-object-storage:global:a/3ag0e9402tyfd5d29761c3e97696b71n:d6f74k03-6k4f-4a82-b165-697354o63903::

데이터 소스에 연결

Discovery 프로젝트에서 다음 단계를 완료하십시오

  1. 탐색 분할창에서 콜렉션 관리를 선택하십시오.

  2. 새 컬렉션을 클릭합니다.

  3. 데이터 소스에 연결해야 합니까? 필드 옆의 링크를 클릭하고 IBM Cloud Object Storage 클릭한 후 다음을 클릭합니다.

  4. 신임 정보 유형을 선택한 후 이전에 수집한 정보로 필드를 채우십시오.

    • IAM
    • HMAC

    다음 을 클릭하십시오.

  5. 콜렉션의 이름을 지정하십시오.

  6. 스토리지에 있는 문서의 언어가 영어가 아닌 경우 적절한 언어를 선택하십시오.

    지원되는 언어 목록은 언어 지원을 참조하십시오.

  7. 선택사항: 동기화 스케줄을 변경하십시오.

    자세한 정보는 크롤링 스케줄 옵션 을 참조하십시오.

  8. 크롤링할 버킷을 선택하세요.

    선택하는 버킷이 많을수록 문서 처리에 더 많은 시간이 소요됩니다.

  9. 콜렉션에 추가할 파일 유형을 제한하려는 경우 포함 또는 제외할 파일 유형의 파일 확장자를 나열할 수 있습니다.

    제외할 파일 유형의 확장자를 나열하도록 선택하는 경우 하나 이상의 파일 확장자를 추가해야 합니다.

    지원되는 파일 유형 목록은 지원되는 파일 유형 을 참조하십시오.

  10. 크롤러가 사이트의 이미지에서 텍스트를 추출하도록 하려면 추가 처리 설정을 펼치고 OCR (Optical Character Recognition) 적용On 로 설정하십시오.

    OCR이 사용 가능하고 문서에 이미지가 포함되어 있으면 처리 시간이 더 오래 걸립니다. 자세한 정보는 OCR(Optical Character Recognition) 을 참조하십시오.

  11. ** 완료**를 누르십시오.

콜렉션이 빠르게 작성됩니다. 콜렉션에 추가될 때 데이터를 처리하는 데 더 많은 시간이 소요됩니다.

진행상태를 확인하려면 활동 페이지로 이동하십시오. 탐색 분할창에서 콜렉션 관리를 클릭한 후 클릭하여 콜렉션을 여십시오.