COSデータソースの設定
Tencent CloudのオブジェクトストレージCOS(Cloud Object Storage)は、ファイルなどのオブジェクトデータを保存するためのサービスです。COSデータソースを設定すると、データ開発プラットフォームでCOSのファイルを読み取り、オフライン同期プランを使ってAEプリセット倉庫の空間テーブルにデータを書き込み、後続の加工や分析に利用できます。
使用制限
- COSは現在オフライン読み取りに対応しており、データの流向はAEプリセット倉庫の空間テーブルです。
- COSをデータの流向とすることには対応していません。また、COSから他の外部データベースへ直接同期することにも対応していません。
- COSストレージを使用する空間テーブルは、現在データ統合に参加できません。データの流向を設定する際は、統合に参加できるプリセット倉庫の空間テーブルを選択してください。
設定を始める前に、対象バケットの地域、完全なBucket名、およびそのバケットにアクセスして対象ファイルを読み取る権限を持つSecret IdとSecret Keyを用意してください。また、プラットフォームの実行環境から該当するCOSサービスにアクセスできることを確認してください。
対応するファイルタイプと設定ルール
COSは以下の5種類のファイルタイプの読み取りに対応しています。データソースの作成時に入力するのは接続パラメータのみです。ファイルパス、ファイルタイプ、読み取りルールはオフライン同期プランで設定します。
| ファイルタイプ | 構成の説明 |
|---|---|
| csv | 列区切り記号と、ヘッダーを飛ばすかどうかを設定できます。デフォルトの区切り記号はカンマです。有効な1文字に対応しており、\t と入力するとTabを表します。\t 以外の複数文字の区切り記号には対応しておらず、ダブルクォート、復帰、改行も区切り記号として使用できません。 |
| text | 列区切り記号と、ヘッダーを飛ばすかどうかを設定できます。デフォルトの区切り記号はカンマです。列区切り記号は正規表現として解析されます。たとえば \t はTab、\s+ は連続する空白を表します。縦線またはドットで列を区切る場合は、それぞれ \| または \. と入力してください。 |
| json | ファイルタイプとしてjsonを選択し、識別されたフィールドとデータプレビューの結果を確認します。 |
| orc | ファイルタイプとしてorcを選択し、識別されたフィールドとデータプレビューの結果を確認します。 |
| parquet | ファイルタイプとしてparquetを選択し、識別されたフィールドとデータプレビューの結果を確認します。 |
ファイルタイプは実際のファイル形式と一致している必要があります。CSVとTextでは区切り記号の処理方法が異なるため、ファイルタイプを切り替えたり読み取りルールを変更したりした後は、データプレビューとフィールド照合を再度確認してください。
COSデータソースの作成
- 対象のワークスペースに入り、データ開発プラットフォーム → バッチ統合 → データソースページでデータソースを追加します。
- 「半構造化」カテゴリで COS を選択し、次のステップをクリックします。
- データソース名、備考、接続パラメータを入力します。実際の利用方法に応じて、本番環境と開発環境で構成を共用するか、それぞれ個別に設定するかを選択します。
- 接続性テストエリアのテストをクリックして、接続結果を確認することをお勧めします。独立環境構成の場合は、本番環境と開発環境をそれぞれテストしてください。
- 設定に誤りがないことを確認したら、完了をクリックします。作成に成功するとデータソースの詳細ページに移動し、接続設定と接続状態を確認できます。
データソース設定パラメータ
| フィールド名 | 説明 |
|---|---|
| * データソース名 | 現在のワークスペース内で一意で、長さは1–80文字です。作成後は名前を変更できません。 |
| 備考 | 任意。最大200文字で、データの用途を記入できます。 |
| 環境構成 | デフォルトは「環境を区別しない」で、本番環境と開発環境で1セットの構成を共用します。「独立環境構成」を選択すると、2セットの接続パラメータをそれぞれ入力します。 |
| * 地域 | バケットが属する地域の略称です(例:ap-nanjing)。中国語の地域名ではなく、実際のバケットの地域を使用してください。 |
| * Bucket | APPIDのサフィックスを含む完全なバケット名を入力します(例:examplebucket-1250000000)。ここには名前を入力し、アクセスドメイン、ファイルパス、cos:// などのプロトコルプレフィックスは入力しません。 |
| * Secret Id | Tencent Cloudのアクセスキーの識別子で、Secret Keyと組み合わせて使用します。 |
| * Secret Key | Secret Idに対応するアクセスキーです。対象バケットへのアクセス権限を持つ認証情報を入力してください。 |
* の付いたパラメータは必須項目です。COSの接続設定ではEndpointを入力する必要はありません。地域とBucketの入力方法については、Tencent Cloudの準備作業とリージョンとアクセスドメインの説明を参照してください。
下図は、既存のCOSデータソースの接続設定エリア全体を示しています。環境の説明、地域、Bucket、Secret Id、Secret Keyが含まれます。機密性の高い値はマスクされています。
図1:COSデータソースの接続設定全体。本番環境と開発環境で1セットの構成を共用しています。グレーで覆われた部分は、マスク済みのパラメータ値です。
接続性テストに失敗した場合は、画面のメッセージに従って、地域とBucketが一致しているか、Secret IdとSecret Keyが正しいか、アカウントに必要なアクセス権限があるか、プラットフォームからCOSへのネットワークに到達できるかを順に確認してください。接続パラメータを変更した後は、再度テストすることをお勧めします。
オフライン同期タスクの作成
データソースの設定が完了したら、バッチ統合 → オフライン同期に移動し、統合プランを追加します。データソースとしてCOSを選択し、作成済みのCOSデータソースを選択します。
データソースを設定
| 構成項目 | 説明 |
|---|---|
| * データソース | 設定済みのCOSデータソースを選択します。 |
| * ファイルパス | Bucket内の相対ファイルパスを入力します(例:incoming/events/data.parquet)。画面にはプリセットのプレフィックスが表示されるため、プロトコルとBucketを重ねて入力する必要はありません。必要に応じて空間パラメータを挿入したり、* ワイルドカードを使用したりできます(例:incoming/events/*)。 |
| * ファイルタイプ | 実際のファイルと一致するcsv、text、json、orc、parquetのいずれかを選択します。 |
| ファイル読み取りルール | csvまたはtextを選択すると、列区切り記号とヘッダーを飛ばすオプションを設定できます。詳しいルールは「対応するファイルタイプと設定ルール」を参照してください。 |
| 空のデフォルトフォルダーが正常にマークされました | 「高度な構成」にあり、デフォルトはオフです。オンにすると、ファイルディレクトリが空の場合にタスクを成功としてマークできます。入力ファイルがなくてもよい場合にのみオンにしてください。 |
パスを入力したら、パスの確認とデータプレビューの機能で、実際の読み取り範囲と解析結果を確認できます。パス、ファイルタイプ、読み取りルールが正しいことを確認してから、データの流向とフィールド照合を設定します。
データの流向とフィールド照合の設定
データの流向としてAEプリセット倉庫の空間テーブルを選択し、目標テーブルに応じて書き込みモードを設定します。上書き書き込みは目標テーブルの既存データに影響するため、実際の同期要件に応じて選択してください。
ソースと流向の設定が完了したら、ソースフィールドと目標フィールドの照合を作成します。対応関係は手動で指定できるほか、同名照合または同行照合も使用できます。1つの目標フィールドに対応できるソースフィールドは1つだけです。名前や位置が同じというだけで誤った照合を作成しないよう、フィールドの意味とタイプを確認してください。
下図は、既存のCOS同期プランにおけるフィールド照合の例です。フィールド名と対応関係は表示用であり、実際にはお使いのファイルの内容と目標テーブルの構造に従ってください。
図2:COSオフライン同期プランにおけるソースフィールドと目標フィールドの照合。
プランの保存と確認
プラン名、責任者、同期速度、備考などの基本情報を入力し、保存をクリックします。保存後は詳細ページで「フィールド照合」と「プラン構成」を確認できます。同期結果を検証する場合は手動実行を使用し、実行記録と目標テーブルのデータを確認します。
オフライン同期プランのタスクフローへのマウント
タスクフローでCOSのデータ同期を実行する場合は、保存済みのオフライン同期プランをタスクフローにマウントできます。
- 統合プランの詳細ページでジョブフローにマウントするをクリックします。
- 対象のタスクフローを選択します。タスクフローを新規作成する場合は、選択ボックス内の新規作成の入口を使用するか、「開発」モジュールで作成します。
- 同期ノード名を入力し、画面で選択できる実行モードを選択して、必要に応じて責任者と備考を設定します。ノードは現在の統合プランに関連付けられます。
- ノードを作成し、マウントしますをクリックします。成功したら、タスクフローに進むをクリックしてノードの設定を確認します。
マウント後に追加されたノードは開発状態です。タスクフローの依存関係とスケジュール設定を確認し、リリースして配信を開始してください。その後は、タスクフローのスケジュールによってこのプランが実行されます。
マウントを解除する場合は、タスクフローの開発モードで対応するオフライン同期ノードを削除します。タスクフローがすでにリリースされている場合は、タスクフローを再リリースして、本番環境のマウント関係も同期して更新する必要があります。

