> ## Documentation Index
> Fetch the complete documentation index at: https://developer.qaip.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# DuckDBファイル

> QAIPに取り込んだチャンクデータをDuckDBファイルとしてエクスポートする

## DuckDBとは

DuckDBは軽量かつ高速なインプロセス型分析用データベースです。ローカルでのデータ分析・ETL処理に適しています。

詳細な情報とインストール手順は[公式ドキュメント](https://duckdb.org/docs/stable/clients/python/overview)を参照してください。

## エクスポート手順

1. サイドバーから「DuckDBファイル」を選択
2. 「新規ジョブ作成」または「DuckDBファイルの再作成」をクリック
3. DuckDBファイルのダウンロードURLが発行されるので、そのURLにアクセスしてダウンロード

## スキーマ

ダウンロードしたファイルはDuckDB形式で保存されており、以下３つのテーブルが含まれています。

* chunks
* crawled\_pages
* crawled\_files

### テーブル: chunks

検索・チャットで使用されるチャンクデータが格納されています。

| Column                 | Type        | Description                          |
| ---------------------- | ----------- | ------------------------------------ |
| id                     | `VARCHAR`   | チャンクのID                              |
| source\_type           | `VARCHAR`   | ソースの種類                               |
| source\_id             | `VARCHAR`   | ソースのID<br />（例：クロールではファイル毎に一意なID）    |
| source\_group\_id      | `VARCHAR`   | ソースグループのID<br />（例：クロールではジョブ毎に一意なID） |
| source\_creation\_time | `TIMESTAMP` | ソースの作成時間                             |
| text                   | `VARCHAR`   | チャンクのテキスト                            |
| index                  | `INTEGER`   | チャンクの順番                              |
| title                  | `VARCHAR`   | チャンクのタイトル                            |
| url                    | `VARCHAR`   | チャンクのURL                             |
| page                   | `INTEGER`   | ページ番号                                |
| content\_type          | `VARCHAR`   | コンテンツタイプ                             |
| named\_entities        | `VARCHAR[]` | 形態素解析器によって抽出された名詞                    |

### テーブル: crawled\_pages

[クロール](/docs/datasources/crawl)によってダウンロードしたHTMLのページ情報が格納されています。

| Column         | Type                    | Description   |
| -------------- | ----------------------- | ------------- |
| id             | `VARCHAR`               | ページのID        |
| time           | `TIMESTAMP`             | 時間            |
| crawl\_id      | `VARCHAR`               | クロールのID       |
| url            | `VARCHAR`               | URL           |
| title          | `VARCHAR`               | タイトル          |
| language       | `VARCHAR`               | 言語            |
| charset        | `VARCHAR`               | 文字セット         |
| metadata       | `MAP(VARCHAR, VARCHAR)` | メタデータ         |
| links          | `VARCHAR[]`             | ページに含まれるリンク   |
| link\_from     | `VARCHAR`               | クロール時に辿ったリンク元 |
| canonical\_url | `VARCHAR`               | 正規化URL        |
| status         | `INTEGER`               | ステータス         |

### テーブル: crawled\_files

[クロール](/docs/datasources/crawl)によってダウンロードしたファイル情報が格納されています。

| Column         | Type        | Description |
| -------------- | ----------- | ----------- |
| id             | `VARCHAR`   | ファイルのID     |
| creation\_time | `TIMESTAMP` | 作成時間        |
| crawl\_id      | `VARCHAR`   | クロールのID     |
| url            | `VARCHAR`   | URL         |
| length         | `INTEGER`   | ファイルの長さ     |
| ct\_label      | `VARCHAR`   | コンテンツタイプ    |
