Content Mining 애플리케이션을 사용하여 데이터 분석

Discovery 컨텐츠 마이닝 애플리케이션을 사용하여 데이터를 분석하십시오. 애플리케이션은 패턴, 추세 및 이상 항목을 찾는 데 도움이 될 수 있는 시각화의 정보 서브세트를 표시합니다.

설치된 배포판이나 Enterprise 및 Premium 요금제 관리형 배포판의 사용자만 콘텐츠 마이닝 애플리케이션을 사용할 수 있습니다.

개요 동영상

동영상 대본

Watson Discovery Stuart Strolin에서 제공하는 컨텐츠 마이닝 프로젝트입니다. (음악 소개) 이 비디오의 목적은 Watson Discovery의 컨텐츠 마이닝 프로젝트에 친숙해지도록 하는 것입니다.

컨텐츠 마이닝은 Watson Discovery 의 기본 유스 케이스 중 하나이며 인사이트를 찾고 숨겨진 의미를 추출하기 위해 구조화된 데이터와 구조화되지 않은 데이터를 모두 분석하고 탐색하는 데 사용됩니다. 이는 시민 분석가와 데이터 과학자 모두에 의해 사용됩니다.

사용자 인터페이스가 특정 산업 또는 데이터 세트에 특정하지 않으므로 컨텐츠 마이닝 프로젝트를 모든 유형의 분석에 사용할 수 있습니다.

이 시나리오에서는 가상 자동차 회사의 분석가입니다. 운영상의 보고에 의하면 그 회사는 그들의 차들 중 한 대의 비정상적인 사고율을 알려 주었다. 너의 임무는 그 이유를 알아내는 것이다.

컨텐츠 마이닝 프로젝트를 사용하여 국가 자동차 사고 보고서에서 구조화되지 않은 데이터를 보고 분석을 시작합니다. 자동차 모델을 선택하고 분석을 시작할 수 있는 인터페이스가 표시됩니다 (콜렉션 페이지에서). 이 경우에는 Hill Walker에 관심이 있습니다. 페이지의 시작 부분에 있는 검색 섹션에 해당 정보를 입력할 수 있습니다. 하지만 항목을 클릭하는 것이 더 쉽습니다. 원하는 만큼 많은 검색 조건을 추가할 수 있습니다. 그러나 실제로는 애플리케이션이 분석을 안내하도록 하려고 합니다.

이제 탐색 보기 (안내 모드) 가 표시됩니다. 분석을 추적하고 다음 단계에 대한 옵션을 제공합니다. 또한 현재 분석 상태와 일치하는 문서 수를 제공합니다. 이 작은 컬렉션에서, Hill Walker와 관련된 문서의 수는 단지 51입니다. 프로덕션 데이터 세트에서는 일반적으로 숫자가 훨씬 더 큽니다. 경향 및 이상 항목을 분석하는 것은 일반적이지 않은 것이 있는지 확인할 수 있으므로 시작하기에 좋은 방법입니다.

즉시, 여러분은 힐 워커가 12월과 1월에 문제가 있다는 것을 알게 되었습니다. 이 초기 탐색을 12월로 줄여서 추가로 조사하기로 결정합니다.

맨 위에 있는 탐색 보기가 항상 분석 중인 위치를 계속 알려 주는 방법에 유의하십시오. 그런 다음, 상황이 발생하는 이유에 관심이 있으므로 원인 및 특성 분석 을 선택합니다.

'눈' 및 '브레이크' 와 같은 단어가 함께 강조표시되는 것을 볼 수 있습니다 (품사 섹션에서). 따라서 이를 분석에 추가합니다.

Content Miner 프로젝트는 쉽게 읽을 수 있는 소수의 불만으로 조사 범위를 좁혔습니다. (문서 표시를 클릭함)

여기서 공통적인 주제는 눈이 오는 상황에서 브레이크가 작동하는 방식에 예기치 않은 문제가 있다는 것입니다. 이제 엔지니어링 부서에 브레이크 시스템에 대한 자세한 검사를 수행하고 눈이 내리는 상태에서 예상대로 작동하지 않는 이유를 판별하도록 요청하는 데 필요한 정보를 얻게 되었습니다.

이 데모에서는 Watson Discovery 및 컨텐츠 마이닝을 사용하는 시민 분석가가 비정형 텍스트에서 숨겨진 의미를 쉽게 발견할 수 있는 방법을 살펴보았습니다. (기능, 기능 및 유스 케이스 목록)

Watson Discovery 로 무엇을 하시겠습니까? (음악)

작업 방식

데이터를 분석하기 위해 패싯을 사용합니다. 패싯은 이해하기 쉽도록 데이터를 분할하고 정보의 서브세트를 시각화하는 방법을 제공합니다.

콜렉션의 데이터 분석 페이지에서 다음 보기 중 하나에 표시할 데이터를 선택할 수 있습니다.

패싯
문서에 적용되는 인리치먼트에 의해 문서에 추가되는 어노테이션에서 파생된 패싯을 표시합니다. 인리치먼트에는 Part of Speech 또는 Entities와 같은 기본 제공 자연어 처리 인리치먼트가 포함될 수 있습니다. 또한 사용자가 추가하는 사용자 정의 인리치먼트 (예: 사전, 정규식 패턴 및 기계 학습 모델) 도 포함할 수 있습니다.
메타데이터 패싯
데이터에서 파생된 패싯을 표시합니다. 콜렉션에 파일을 추가할 때 Discovery 는 데이터를 분석하고 색인화합니다. 컨텐츠 유형을 식별하기 위해 어노테이션이 추가되고 메타데이터 패싯으로 표시됩니다. 구조화된 데이터 (예: CSV 파일의 레코드) 를 수집할 때 최상의 메타데이터 패싯이 발생합니다. 메타데이터 패싯의 최대 길이는 256자입니다.
사용자 정의
보기에 추가하도록 선택한 패싯만 표시합니다. 인리치먼트 파생 패싯과 컨텐츠 파생 패싯을 혼합하여 사용자 정의 보기에 추가할 수 있습니다.

Content Mining 프로젝트 유형을 작성할 때 Part of Speech 패싯이 데이터에 자동으로 적용됩니다. 이 패싯은 주제에 상관없이 모든 데이터에 대해 유효하므로 시작하기에 좋은 위치입니다. 출력을 통해 데이터에서 가장 일반적인 용어를 빠르게 볼 수 있습니다.

Watson Discovery content mining launch page
Watson Discovery Content Mining application home page

이 시작점에서 유용할 수 있는 데이터를 필터링하는 다른 방법을 판별할 수 있습니다.

데이터가 교통 보고서로 구성된 경우 예를 들어, Part of Speech 패싯은 빈도가 높은 키워드에 엔진, 브레이크, 화재, 스모크스파크와 같은 용어가 포함되어 있음을 표시할 수 있습니다. 이 공통 용어가 제공되면 데이터를 분류하고 필터링하는 데 도움이 되는 사전을 작성할 수 있습니다. 예제의 키워드를 사용하여 다음 사전을 작성할 수 있습니다.

  • 엔진 및 브레이크와 같은 용어에 대한 component 사전
  • 화재, 연기 및 스파크와 같은 용어에 대한 phenomenon 사전

사전 인리치먼트를 데이터에 적용하면 어노테이션이 생성됩니다. 어노테이션을 단어 또는 구문에 추가하는 태그로 간주할 수 있습니다. 여기서 태그는 단어 또는 구문의 의미를 분류하거나 식별합니다. 결과 어노테이션은 데이터를 추가로 필터링하고 분해하는 데 사용할 수 있는 새 패싯으로 작동합니다.

예를 들어, 새 componentphenomenon 패싯을 사용하여 교통 사고와 관련된 구성요소와 현상 간의 상관 관계를 찾을 수 있습니다.

데이터를 분석할 수 있는 방법에 대해 알아보십시오.

자세히 살펴보기

데이터를 더 자세히 살펴보려면 문서에서 다양한 유형의 정보를 찾을 수 있는 AI 모델을 적용하거나 작성하십시오. 비즈니스 또는 위치 이름 및 기타 유형의 고유 명사와 같은 일반적으로 알려진 항목의 멘션을 인식할 수 있는 엔티티 인리치먼트와 같은 기본 제공 자연어 처리 모델을 적용할 수 있습니다. 또는 데이터에 고유한 용어 및 카테고리를 인식하는 사용자 정의 모델을 적용할 수 있습니다.

고유 패싯을 추가하여 분석을 확장하십시오.

시작하기

애플리케이션을 사용하기 전에 Discovery 컨텐츠 마이닝 프로젝트를 작성해야 합니다. 프로젝트가 작성되고 데이터가 업로드되면 컨텐츠 마이닝 애플리케이션을 열 수 있습니다.

자세한 정보는 프로젝트 작성을 참조하십시오.

물론 올바른 유형의 정보를 입력하지 않으면 유용한 인사이트를 얻을 수 없습니다. 일관성 있는 데이터를 포함해야 합니다. 시간 경과에 따른 추세를 찾으려면 데이터에 날짜를 지정하는 데이터 점이 포함되어야 합니다.

CSV 파일 형식으로 제출되는 데이터가 최적입니다. 관심있는 분석 기능을 제공하는 CSV 파일의 샘플은 CSV 파일 분석 을 참조하십시오.