メインコンテンツまでスキップ

データのアーカイブと復元

最終更新 2026/10/03

1. データアーカイブ機能(ta_data_archive)​

データアーカイブ機能は、履歴データや当面使用しないデータを低コストのストレージに移行してアーカイブする機能です。これによりAEクラスターのディスクリソースを解放し、使用コストを節約できます。

1.1 アーカイブコマンド​

#起動
ta-tool data_archive start

#停止
ta-tool data_archive stop

#失敗時の再実行
ta-tool data_archive retry -jobid *******

1.2 アーカイブ方式​

1.2.1 S3方式​

1.2.1.1 環境の準備​

  1. Amazon S3サービスを申し込みます
  2. アーカイブに使用するバケット(Bucket)を作成します。バケットのリージョンはAEクラスターのサーバーと同じにすることをお勧めします
  3. バケットにアクセスできるシークレットキーを作成します

1.2.1.2 コマンド例​

[ta@ta1 ~]$ ta-tool data_archive start
请输入本次工作的JobId,不输入后台随机生成>
------------------------------------------------------------
请输入需要归档的项目appid> 5487f6b**********f9c379aa9bb
------------------------------------------------------------
请输入项目归档的开始时间:YYYY-MM-DD > 2018-01-01
------------------------------------------------------------
请输入项目归档的结束时间:YYYY-MM-DD > 2018-12-31
------------------------------------------------------------
请输入项目归档的事件类型(非必填)>
------------------------------------------------------------
请输入归档存储的类型:hdfs or rsync or s3 > s3
------------------------------------------------------------
请输入S3 AccesskeyID> YOUR_ACCESS_KEY_ID
------------------------------------------------------------
请输入S3 secretAccessKey> YOUR_SECRET_ACCESS_KEY
------------------------------------------------------------
请输入S3 区域代码> cn-****-1
------------------------------------------------------------
请输入S3 存储桶名称> ta************ive
------------------------------------------------------------
请输入S3 文件存储类(默认:STANDARD)> S*****D
------------------------------------------------------------
请输入项目归档的目标目录> data*****_test
------------------------------------------------------------

1.2.1.3 手順の説明​

  1. jobidを入力します。任意に指定することも、バックグラウンドで生成することもできます。タスクが失敗して再実行する際にjobidを指定する必要があるためです。
  2. プロジェクトのappidを入力します
  3. 開始日を入力します(直近1か月の範囲外)
  4. 終了日を入力します(直近1か月の範囲外)
  5. 指定するイベントタイプを入力します(任意)。特定のイベントタイプだけをアーカイブする場合に使用します
  6. アーカイブストレージのタイプとしてS3を選択します
  7. s3のaccesskeyidを入力します
  8. secretAccessKey(S3のIAMサービスで管理)を入力します
  9. バケットのリージョンコードを指定します
  10. バケット名を入力します
  11. ストレージクラスを選択します(デフォルトは標準)。ストレージクラスのうちGLACIERとDEEP_ARCHIVEは低コストのデータアーカイブ向けに設計されていますが、データを復元する際に解凍操作が必要で、手間がかかります。
  12. アーカイブ先のディレクトリ(対象バケットの下にこのディレクトリが作成され、アーカイブデータはこのディレクトリに格納されます)

1.2.2 HDFS方式​

1.2.2.1 環境の準備​
  1. AEクラスターとネットワークで相互に通信できるHDFS環境を準備します
1.2.2.2 コマンド例​
[ta@ta1 ~]$ ta-tool data_archive start
请输入本次工作的JobId,不输入后台随机生成>
------------------------------------------------------------
请输入需要归档的项目appid> 5487************a9bb
------------------------------------------------------------
请输入项目归档的开始时间:YYYY-MM-DD > 2018-01-01
------------------------------------------------------------
请输入项目归档的结束时间:YYYY-MM-DD > 2018-12-31
------------------------------------------------------------
请输入项目归档的事件类型(非必填)>
------------------------------------------------------------
请输入归档存储的类型:hdfs or rsync or s3 > hdfs
------------------------------------------------------------
请输入项目归档的HFDS URL地址> hdfs-nm-url
------------------------------------------------------------
请输入项目归档的HFDS 的用户名> hdfsUserName
------------------------------------------------------------
请输入项目归档的目标目录> hdfs******test
------------------------------------------------------------
1.2.2.3 手順の説明​
  1. jobidを入力します。任意に指定することも、バックグラウンドで生成することもできます。タスクが失敗して再実行する際にjobidを指定するために使用します。
  2. プロジェクトのappidを入力します
  3. 開始日を入力します(直近1か月の範囲外)
  4. 終了日を入力します(直近1か月の範囲外)
  5. 指定するイベントタイプを入力します(任意)。特定のイベントタイプだけをアーカイブする場合に使用します
  6. アーカイブストレージのタイプとしてhdfsを選択します
  7. 書き込み側のhdfsのアドレスを入力します。ポートがデフォルトの場合はhostnameを入力するだけで構いません
  8. 書き込み側のhdfsのユーザー名を入力します
  9. アーカイブ先のディレクトリを入力します。絶対パスを使用することをお勧めします。絶対パスでない場合は/user/hdfsユーザーディレクトリ/アーカイブ先ディレクトリ/に格納されます

1.2.3 rsync方式​

1.2.3.1 環境の準備​
  1. rsyncのdaemonモードでサーバー側を構築し、シークレットキーファイルをAEクラスター内のコマンド実行ノードにコピーします
1.2.3.2 コマンド例​
[ta@ta1 ~]$ ta-tool data_archive start
请输入本次工作的JobId,不输入后台随机生成>
------------------------------------------------------------
请输入需要归档的项目appid> 548*****************9bb
------------------------------------------------------------
请输入项目归档的开始时间:YYYY-MM-DD > 2018-01-01
------------------------------------------------------------
请输入项目归档的结束时间:YYYY-MM-DD > 2018-12-31
------------------------------------------------------------
请输入项目归档的事件类型(非必填)>
------------------------------------------------------------
请输入归档存储的类型:hdfs or rsync or s3 > rsync
------------------------------------------------------------
请输入目标RSYNC服务器IP地址> rsyncIp
------------------------------------------------------------
请输入目标RSYNC服务器端口> rsyncPort
------------------------------------------------------------
请输入目标RSYNC服务器用户名> rsyncUser
------------------------------------------------------------
请输入目标RSYNC服务器秘钥文件位置> passwordFilePath
------------------------------------------------------------
请输入目标RSYNC服务器模块名称> modelName
------------------------------------------------------------
sending incremental file list
/tmp/
/tmp/d41d8c*****ecf8427e.data

sent 99 bytes received 15 bytes 228.00 bytes/sec
total size is 11 speedup is 0.10 (DRY RUN)
请输入项目归档的目标目录> rsync******test_dir
1.2.3.3 手順の説明​
  1. jobidを入力します。任意に指定することも、バックグラウンドで生成することもできます。タスクが失敗して再実行する際にjobidを指定するために使用します。
  2. プロジェクトのappidを入力します
  3. 開始日を入力します(直近1か月の範囲外)
  4. 終了日を入力します(直近1か月の範囲外)
  5. 指定するイベントタイプを入力します(任意)。特定のイベントタイプだけをアーカイブする場合に使用します
  6. アーカイブストレージのタイプとしてrsyncを選択します
  7. rsyncサーバーのipを入力します
  8. rsyncサーバーのポートを入力します
  9. rsyncのユーザー名を入力します
  10. rsyncのシークレットキーファイルの場所を入力します。ファイルは任意のディレクトリに置き、ファイル権限はchmod 600にする必要があります
  11. rsyncのモジュール名を入力します(このステップでは、それまでに入力した情報を使ってrsyncが使用可能かどうかを検証します)
  12. アーカイブ先のディレクトリを入力します

2. データ復元機能(ta_data_reload)​

データ復元機能は、以前にアーカイブしたデータをAEクラスターにインポートして再び使用できるようにする機能です。通常、過去数年間のトレンドを確認する際に使用します。

インポートする前に、ディスク容量が十分かどうかを確認してください。

2.1 復元コマンド​

#起動
ta-tool data_reload start

#停止
ta-tool data_reload stop

#失敗時の再実行
ta-tool data_reload retry -jobid *******

2.2 復元方式​

2.2.1 S3方式​

2.2.1.1 環境の準備​
  1. Amazon S3サービスを申し込みます
  2. アーカイブに使用するバケット(Bucket)を作成します。バケットのリージョンはAEクラスターのサーバーと同じにすることをお勧めします
  3. バケットにアクセスできるシークレットキーを作成します
2.2.1.2 コマンド例​
[ta@ta1 log]$ ta-tool data_reload start
请输入本次工作的JobId,不输入后台随机生成>
------------------------------------------------------------
请输入需要归档的项目appid> 5487f6************a9bb
------------------------------------------------------------
请输入项目归档的开始时间:YYYY-MM-DD > 2018-01-01
------------------------------------------------------------
请输入项目归档的结束时间:YYYY-MM-DD > 2018-12-31
------------------------------------------------------------
请输入项目归档的事件类型(非必填)>
------------------------------------------------------------
请输入归档存储的类型:hdfs or rsync or s3 > s3
------------------------------------------------------------
请输入S3 AccesskeyID> YOUR_ACCESS_KEY_ID
------------------------------------------------------------
请输入S3 secretAccessKey> YOUR_SECRET_ACCESS_KEY
------------------------------------------------------------
请输入S3 区域代码> cn*****-1
------------------------------------------------------------
请输入S3 存储桶名称> ta*****ve
------------------------------------------------------------
请输入项目归档的目标目录> data*******t_1
------------------------------------------------------------
2.2.1.3 手順の説明​
  1. jobidを入力します。任意に指定することも、バックグラウンドで生成することもできます。タスクが失敗して再実行する際にjobidを指定するために使用します。
  2. プロジェクトのappidを入力します
  3. 開始日を入力します(直近1か月の範囲外)
  4. 終了日を入力します(直近1か月の範囲外)
  5. 指定するイベントタイプを入力します(任意)。特定のイベントタイプだけをアーカイブする場合に使用します
  6. アーカイブストレージのタイプとしてS3を選択します
  7. s3のaccesskeyidを入力します
  8. secretAccessKey(S3のIAMサービスで管理)を入力します
  9. バケットのリージョンコードを指定します
  10. バケット名を入力します
  11. ストレージクラスを選択します(デフォルトは標準)。ストレージクラスがGLACIERまたはDEEP_ARCHIVEの場合は、事前にS3でデータの解凍操作を行ってください。行わない場合、データを取得できません
  12. アーカイブ先のディレクトリ(対象バケットの下にこのディレクトリが作成され、アーカイブデータはこのディレクトリに格納されます)

注意:パラメータを入力する際は、アーカイブ時のバケット名およびディレクトリパスと一致させてください。

2.2.2 HDFS方式​

2.2.2.1 環境の準備​
  1. AEクラスターとネットワークで相互に通信できるHDFS環境を準備します
2.2.2.2 コマンド例​
[ta@ta1 log]$ ta-tool data_reload start
请输入本次工作的JobId,不输入后台随机生成>
------------------------------------------------------------
请输入需要归档的项目appid> 5487*******************9bb
------------------------------------------------------------
请输入项目归档的开始时间:YYYY-MM-DD > 2018-01-01
------------------------------------------------------------
请输入项目归档的结束时间:YYYY-MM-DD > 2018-12-31
------------------------------------------------------------
请输入项目归档的事件类型(非必填)>
------------------------------------------------------------
请输入归档存储的类型:hdfs or rsync or s3 > hdfs
------------------------------------------------------------
请输入项目归档的HFDS URL地址> hdfs-nm-url
------------------------------------------------------------
请输入项目归档的目标目录> hdfs******test
------------------------------------------------------------
2.2.2.3 手順の説明​
  1. jobidを入力します。任意に指定することも、バックグラウンドで生成することもできます。タスクが失敗して再実行する際にjobidを指定するために使用します。
  2. プロジェクトのappidを入力します
  3. 開始日を入力します(直近1か月の範囲外)
  4. 終了日を入力します(直近1か月の範囲外)
  5. 指定するイベントタイプを入力します(任意)。特定のイベントタイプだけをアーカイブする場合に使用します
  6. アーカイブストレージのタイプとしてhdfsを選択します
  7. 書き込み側のhdfsのアドレスを入力します。ポートがデフォルトの場合はhostnameを入力するだけで構いません
  8. 書き込み側のhdfsのユーザー名を入力します
  9. アーカイブ先のディレクトリを入力します

注意:パラメータを入力する際は、アーカイブ時のディレクトリパスと一致させてください。

2.2.3 rsync方式​

2.2.3.1 環境の準備​
  1. rsyncのdaemonモードでサーバー側を構築し、シークレットキーファイルをAEクラスター内のコマンド実行ノードにコピーします
2.2.3.2 コマンド例​
[ta@ta1 log]$ ta-tool data_reload start
请输入本次工作的JobId,不输入后台随机生成>
------------------------------------------------------------
请输入需要归档的项目appid> 54****************9bb
------------------------------------------------------------
请输入项目归档的开始时间:YYYY-MM-DD > 2018-01-01
------------------------------------------------------------
请输入项目归档的结束时间:YYYY-MM-DD > 2018-12-31
------------------------------------------------------------
请输入项目归档的事件类型(非必填)>
------------------------------------------------------------
请输入归档存储的类型:hdfs or rsync or s3 > rsync
------------------------------------------------------------
请输入目标RSYNC服务器IP地址> rsyncIp
------------------------------------------------------------
请输入目标RSYNC服务器端口> rsyncPort
------------------------------------------------------------
请输入目标RSYNC服务器用户名> rsyncUser
------------------------------------------------------------
请输入目标RSYNC服务器秘钥文件位置> passwordFilePath
------------------------------------------------------------
请输入目标RSYNC服务器模块名称> modelName
------------------------------------------------------------
sending incremental file list
/tmp/
/tmp/d41d8cd98f00b204e9800998ecf8427e.data
sent 99 bytes received 15 bytes 20.73 bytes/sec
total size is 11 speedup is 0.10 (DRY RUN)
请输入项目归档的目标目录> rsync******test_dir
2.2.3.3 手順の説明​
  1. jobidを入力します。任意に指定することも、バックグラウンドで生成することもできます。タスクが失敗して再実行する際にjobidを指定するために使用します。
  2. プロジェクトのappidを入力します
  3. 開始日を入力します(直近1か月の範囲外)
  4. 終了日を入力します(直近1か月の範囲外)
  5. 指定するイベントタイプを入力します(任意)。特定のイベントタイプだけをアーカイブする場合に使用します
  6. アーカイブストレージのタイプとしてrsyncを選択します
  7. rsyncサーバーのipを入力します
  8. rsyncサーバーのポートを入力します
  9. rsyncのユーザー名を入力します
  10. rsyncのシークレットキーファイルの場所を入力します。ファイルは任意のディレクトリに置き、ファイル権限はchmod 600にする必要があります
  11. rsyncのモジュール名を入力します(このステップでは、それまでに入力した情報を使ってrsyncが使用可能かどうかを検証します)
  12. アーカイブ先のディレクトリを入力します

注意:パラメータを入力する際は、アーカイブ時のディレクトリパスと一致させてください。

このページは役に立ちましたか?