上传数据
您可以随时从本地文件系统执行一次性文档上载,以向项目添加数据。
一次最多可以上载 200 个文件。
要处理大于 200 个文件的文档集,您可以将这些文件添加到外部数据源,并使用数据源搜寻器来上载这些文件。 对于 IBM Cloud Pak for Data 部署,您可以使用 本地文件系统 数据源来实现此目的。
有关每个文件允许的最大大小的更多信息,请参阅 文档限制。
在将 CSV 文件上载到内容挖掘项目之前,请考虑将头添加到源文件,以便从该文件生成的任何字段都具有有意义的名称。 如果没有头,那么将为字段提供通用名称,例如 column_0 和 column_1 等。
要上传数据,请完成以下步骤:
-
打开项目,转至“管理集合”页面,然后单击 新建集合。
-
根据部署类型执行以下操作:
IBM Cloud Pak for Data IBM Software Hub
-
选择“上载数据”作为数据源,然后单击“下一步”。
您还可以连接到其他数据源,而不是上载数据,例如复用集合中的数据或搜寻外部数据源。 有关更多信息,请参阅 复用集合中的数据 和 Cloud Pak for Data 数据源概述。
-
命名集合。 如果存储中文档的语言不是英语,请选择相应的语言。 有关受支持语言的列表,请参阅语言支持。
-
(可选) 单击 更多处理设置 以展开菜单。 您可以选择以下设置:
-
将 应用光学字符识别 (OCR) 切换器设置为 开启 以启用 OCR。
启用 OCR 并且您的文档包含图像时,处理需要更长时间。 有关更多信息,请参阅 光学字符识别。
-
将 建立索引时使用词干而不是词元化 切换器设置为 开启,以使用词干而不是词元化来规范化索引和查询中的词。 有关更多信息,请参阅 对未整理的数据启用词干提取。
-
-
单击下一步
-
通过浏览要搜寻的文件来上载数据。
您可以将要添加的文档拖到集合中。
有关受支持的文件类型的更多信息,请参阅 受支持的文件类型。
-
单击完成。
IBM Cloud
-
命名集合。 如果存储中文档的语言不是英语,请选择相应的语言。 有关受支持语言的列表,请参阅语言支持。
-
通过浏览要添加的文件来上载数据。
您可以将要添加的文档拖到集合中。
有关受支持的文件类型的更多信息,请参阅 受支持的文件类型。
您还可以连接到其他数据源,而不是上载数据,例如复用集合中的数据或搜寻外部数据源。 要连接到其他数据源,请单击 需要连接到数据源旁边的链接? 字段。 有关更多信息,请参阅 复用集合中的数据 和 云数据源概述。
-
(可选) 单击 更多处理设置 以展开菜单。 您可以选择以下选项:
-
将 应用光学字符识别 (OCR) 切换器设置为 开启 以启用 OCR。
启用 OCR 并且您的文档包含图像时,处理需要更长时间。 有关更多信息,请参阅 光学字符识别。
-
将 建立索引时使用词干而不是词元化 切换器设置为 开启,以使用词干而不是词元化来规范化索引和查询中的词。 有关更多信息,请参阅 对未整理的数据启用词干提取
-
-
单击完成。
-
文件上载已快速完成。 在将数据添加到集合时,处理数据需要更多时间。 上载并处理文件后,“活动”页面将显示上载结果。
与已搜寻的数据源不同,您无法调度已上载文件的定期更新。 如果要添加更高版本的文件,请删除该文件的较低版本,然后上载最新版本。
有关如何对将文档添加到集合时可能迂到的问题进行故障诊断的信息,请参阅 对摄入进行故障诊断。
有关后续操作的更多信息,请参阅 如何处理数据源。