中国では、ヒューマノイドロボットやフィジカルAIを学習させるためのデータを大量に生産する施設が各地に作られてきました。中国語では具身智能训练场、数采中心などと呼ばれますが、本記事では分かりやすくフィジカルAI学習データ拠点(データファクトリー)と表記します。
2026年9月20日、中国テックメディアの虎嗅は、中国国内で公開情報を確認できた集中型データ収集拠点106件を調査し、そのうち84件(79.25%)がすでに稼働していると報じました(出典:虎嗅)。この106件は中国政府の公式統計ではなく、虎嗅が公開情報と業界関係者への取材から独自に集計した数字です。
今回の調査で重要なのは、中国に100カ所以上の施設ができたという数字そのものではありません。中国のフィジカルAI産業が、データ拠点をとにかく建設する段階から、そこで作るデータは本当に使えるのか、誰がお金を払うのか、継続して運営できるのかを問われる段階へ移ったことです。
本記事は2026年9月20日時点の情報に基づきます。
フィジカルAIのデータファクトリーとは何か
フィジカルAIのデータファクトリーとは、人間がロボットを遠隔操作するなどして作業を繰り返し、その際に発生する映像・関節角度・力覚・動作軌跡などのデータを集中的に記録し、モデル学習に使える形で供給する施設です。
ChatGPTのようなLLMは、ウェブ上に存在する大量の文章や画像を学習できます。一方、ロボットが現実世界で物を持つ、扉を開ける、部品を組み立てるといった動作を学ぶには、画像だけでは足りません。カメラ映像に加えて、ロボットの関節角度、手先の位置、力覚、触覚、動作軌跡、成功・失敗の結果などを組み合わせたデータが必要になります。
こうした施設は、単なるロボットの練習場ではありません。データ収集、データ処理、モデル学習、実機評価、失敗原因の分析、再学習までをつなぐフィジカルAI開発のインフラとして位置づけられています。中国情報通信研究院(中国信通院。中国工業情報化部直属のシンクタンク)も、具身智能训练场を、現実の物理環境でデータ生産、モデル訓練、能力検証、反復改善を行うための重要インフラと定義しています(出典:新華社)。
中国では2025年から建設が急増した
虎嗅の集計によると、中国の集中型データ収集拠点は2025年から急増しました。2024年3月から2025年3月までは月平均約2.7件だった新規プロジェクトが、2025年4月から2026年1月には月平均約7.3件まで増えています。
建設のピークは2026年第1四半期で、その後は新規プロジェクト数が減少し、すでに建設された施設が次々と稼働段階へ入りました。2026年8月時点で、虎嗅が確認した106拠点のうち84拠点が稼働しています。
一方、中国信通院の《具身智能训练场研究报告(2026年)》では、2026年6月末時点で全国に建設・稼働済み70カ所超、さらに建設中または計画中46カ所とされています(出典:新華社)。対象範囲や調査時点が異なるため、虎嗅の106件と単純比較することはできませんが、中国全土で短期間に多数の施設が整備されたことは共通しています。
| 集計主体 | 対象 | 時点 | 拠点数 |
|---|---|---|---|
| 虎嗅(独自集計) | 公開情報で確認できた集中型データ収集拠点 | 2026年8月 | 106件(うち稼働84件) |
| 中国信通院(研究報告) | 具身智能训练场 | 2026年6月末 | 建設・稼働済み70カ所超、建設中・計画中46カ所 |
中国信通院によれば、こうした施設は省都や一線都市だけではなく、三線、四線、五線都市にも広がっています。含まれるシーンでは工業製造が86%と最も多く、中国のフィジカルAIが工場や物流を重要な学習・実装先としていることが分かります。
この記事のテーマについて、貴社の状況に合わせて個別にご相談いただけます。
中国の現地調査・企業視察・製品調達・導入検討など、目的に合わせて必要な支援を組み立てます。
通常1〜2営業日以内にご返信します。依頼内容が固まっていない段階でも構いません。
なぜ地方政府までデータファクトリーを作ったのか
背景には、単純なロボットの学習データ不足だけではない事情があります。
フィジカルAI産業を誘致したい地方政府にとって、ロボット工場やAI大手企業の研究開発拠点を新しく誘致するには時間がかかります。一方、データ収集拠点であれば、施設を用意し、数十台のロボットや遠隔操作装置を導入し、人員を配置することで比較的短期間にプロジェクトを立ち上げられます。虎嗅の取材に対し、地方の誘致に関わった関係者は、データ拠点の最大の魅力は立ち上がりの速さだと説明しています。
ロボットメーカーにもメリットがあります。地方政府や共同運営主体が数十台から100台単位でロボットを導入すれば、本体メーカーにとってまとまった販売先になります。導入されたロボットはその後、実機データを収集し、自社のAIモデル改善にも利用できます。
つまり、地方政府は産業誘致の実績が欲しい、ロボットメーカーは本体を販売したい、AIモデル開発側は実機データが欲しい、という三つの需要が重なったことで、データファクトリーの建設が一気に進んだと整理できます。虎嗅の調査でも、政企共同型のプロジェクトが最も多く、施設やデータ収集設備、ロボット本体、プラットフォーム、運営サービスをまとめて導入する案件が確認されています。
5,000台を超えるロボットがデータ収集に使われている可能性
虎嗅が調査した106拠点のうち、ロボット配備数を公開している52拠点だけでも約3,972台が確認されています。公開されていない施設を含めると、中国全国の集中型データ収集拠点で稼働するロボットは少なくとも5,000台を超えると虎嗅は推計しています。
ただし、大型施設ばかりではありません。55.8%の施設はロボット50台以下で、300台規模の大型施設がある一方、中小規模の拠点も多く存在します。
メーカー別に見ると、虎嗅の集計では調査対象プロジェクトでの登場回数が次のとおりでした。
| ロボットメーカー | 登場プロジェクト数 |
|---|---|
| Agibot | 31 |
| Leju | 15 |
| UBTECH | 13 |
| Unitree | 10 |
| Galbot | 10 |
これは販売台数そのものではなく、調査対象プロジェクトで確認された回数である点には注意が必要です(出典:虎嗅)。この数字から分かるのは、データ拠点の建設がAIモデル開発だけではなく、中国ロボットメーカーに新たな本体需要を生み出していることです。
最大の問題は集めたデータを別のロボットで使えるのか
今後のデータファクトリーを考えるうえで最も影響が大きいのが、データの再利用性です。
虎嗅の調査では、65.96%の施設が単一ブランドのロボットを中心に構成され、複数ブランドを導入している施設は34.04%でした。単一メーカーのロボットに統一すれば、遠隔操作装置、データ形式、センサー構成、制御方法を統一できるため、データを効率よく生産できます。しかし、そのデータを別メーカーのロボットへそのまま移せるとは限りません。
例えば同じ引き出しを開けるという作業でも、ロボットによって腕の長さ、関節数、関節配置、ハンドの構造、カメラ位置、力覚センサー、制御周期が異なります。低レベルの関節軌跡や制御信号ほど特定のロボット本体への依存度が高くなり、別の機体で利用するには変換や再学習、場合によってはデータの再収集が必要です。
この問題は跨本体(異なるロボット本体をまたいだデータ利用)と呼ばれ、中国のフィジカルAI業界でも重要な課題になっています。複数ブランドを同じ施設に置くだけでは解決せず、動作マッピング、データの正規化、インターフェース、センサー情報の対応付けといった技術が必要です。虎嗅も、異なる本体間でデータがどの程度移行可能なのかについて、現時点では統一された答えがないとしています。
データ価格は1時間いくらだけでは評価できない
虎嗅の業界調査では、2026年時点のデータ価格として次のレンジが示されています(出典:虎嗅)。
| データの種類 | 1時間当たりの価格目安 |
|---|---|
| 実機ロボットによる遠隔操作データ | 約500〜1,000元 |
| UMIなどロボット本体を使わない方式 | 約300〜400元 |
| シミュレーション・合成データ | 約200〜500元 |
ただし、この数字をロボットデータの相場と単純に考えるべきではありません。同じ100時間でも、遠隔操作者の技能、タスクの難易度、成功率、センサー情報の品質、データ欠損、既存データとの重複によって、実際にAIモデルの学習へ投入できるデータ量は変わります。100時間記録しても、そのすべてが有効な学習データになるわけではありません。
そのため、買い手側の関心も、何時間のデータを買えるかから、そのデータを使うとモデルの性能がどの程度改善するのかへ移り始めています。今後は単純なデータ収集時間ではなく、検収合格率、タスク成功率の改善、異なるロボットへの再利用性、失敗データの希少性などが価格を左右するようになる可能性があります。
84拠点が稼働しても、誰が買うのかという問題が残る
集中型データファクトリーには、大きく三つのデータ利用先があります。
- 自社利用:ロボットメーカーやAIモデル企業が自社施設でデータを集め、自社モデルの学習や製品改善に使う。データファクトリー単体で利益を上げる必要はない
- 第三者へのデータ販売・受託収集:顧客が必要とするロボット、作業、環境を指定し、それに合わせてデータを生産する
- オープンソース化:一定量のデータを公開し、研究者や開発者を集めて自社のモデルやロボットを中心としたエコシステムを広げる
問題になるのは、独立した第三者データファクトリーです。虎嗅が取材した運営事業者によると、データを試験的に購入する企業は存在するものの、その後も継続的に大量購入する顧客はまだ限られています。大手ロボットメーカーは自社でデータ収集設備を整え、中小企業には大量の実機データを継続購入するだけの予算がないという構造です。
一方で、ロボットの減価償却、修理、遠隔操作人員、施設費、模擬環境の構築、データ洗浄、アノテーション、品質検査などのコストは継続的に発生します。100台のロボットを置いた施設があっても、100台を毎日稼働させるだけの顧客注文が存在するとは限りません。建設補助や初期投資だけではなく、その後の継続需要を作れるかが、次の競争になります。
データ収集方法そのものも変わり始めている
もう一つのリスクは、データの作り方が急速に変化していることです。
虎嗅が調査した106拠点では、遠隔操作を使う施設が83件(79.05%)と依然として主流です。一方、人間がカメラやセンサーを装着して作業するEgo型、UMI(ロボット本体を使わず、手持ちのグリッパーで人間の作業を記録する方式)、モーションキャプチャ、シミュレーション、合成データなども利用され始めています。ワールドモデルを利用して学習サンプルを生成しようとする研究開発も進んでいます。
実機を使った遠隔操作データには、実際のロボットで発生する接触、摩擦、誤差、振動などを含められるという大きな価値があります。一方で、ロボットを一台ずつ人間が操作するため、人件費と設備費がかかり、機体も消耗します。そのため今後は、すべてのデータを実機で収集するのではなく、公開データ、人間行動データ、シミュレーション、合成データ、実機データを組み合わせる方向へ進むと考えられます。
中国ではデータ量からデータ品質の標準化へ
中国政府側でも、評価軸を単なるデータ量から品質へ移そうとする動きが見えます。
2026年4月24日には、中国国家データ局主管の国家標準計画として「高质量数据集 具身智能 面向训练基地的数据采集与模型训练规范」と「高质量数据集 具身智能 仿真合成数据生成与处理规范」が登録されました。前者には北京理工大学、Galbot、中国電子技術標準化研究院などが、後者にはGalbot、中国科学院ソフトウェア研究所などが起草組織として参加しています。いずれも記事執筆時点では策定プロセス中です(出典:全国標準情報公共服務平台(採集・訓練規範)/同(仿真合成データ規範))。
また、「人工智能 具身智能数据训练场建设指南」についても国家標準化のプロジェクトが進められており、UBTECH、HUAWEI Cloud、北京人形机器人创新中心、Xiaomi Roboticsなど多数の企業・研究機関が参加しています(出典:全国標準情報公共服務平台)。
この動きからも、競争の中心が、何台のロボットを置いたか、年間何万時間データを作れるかだけではなく、データ品質、標準化、異なるロボット間での利用可能性へ広がっていることが分かります。
今後、生き残るデータファクトリーは何が違うのか
現時点で、集中型データファクトリーそのものが不要になったと判断するのは早いと考えます。
ロボットメーカーが自社AIモデルを継続的に改善するのであれば、自社データ拠点には明確な用途があります。また、特定企業から継続的な受託案件を得られる第三者事業者や、複数メーカーのロボットを扱い、データ変換・品質管理・モデル評価まで一体で提供できる施設にも役割があります。一方、100台のロボットを並べれば大量のデータを売れるというモデルは、今後厳しくなる可能性があります。
重要になるのは、誰がデータを購入しているのか、その顧客が再購入しているのか、収集したデータのうち何%が実際の学習に利用できるのか、別のロボットへどこまで再利用できるのか、そしてデータを追加したことでモデル性能がどこまで向上したのかです。フィジカルAIのデータ産業も、データを大量生産する能力から、使えるデータを継続的に生産し、モデル改善につなげる能力へ競争軸が変わり始めています。
日本企業にとって何を意味するのか
日本企業がこの動きを見る際、中国と同じように巨大な集中型データファクトリーを作ることだけを考える必要はありません。
日本には、自動車、電子部品、機械、物流、食品、化学など、実際の生産現場が数多く存在します。そこでは、部品のばらつき、設備の癖、人との干渉、作業変更、異常停止、復旧作業、安全確認など、模擬環境だけでは完全に再現できない状況が日常的に発生します。こうした実際の現場でしか取れないデータは、一般的な把持や搬送のデータが大量に流通するようになった後でも価値を持つ可能性があります。
日本企業がフィジカルAIを導入する際に、事前に整理しておくべき条件は次のとおりです。
- 現場で収集したデータを誰が所有するのか
- ロボットメーカー側のモデル改善に二次利用されるのか
- データが海外へ移転されるのか
- 競合他社向けのモデルにも利用されるのか
フィジカルAI時代には、工場や物流センターは単なるロボットの導入先ではありません。ロボットを賢くするための重要なデータ供給源にもなります。深センで中国のロボット企業と接していると、日本の製造現場のデータを求める声は確実に増えており、契約条件を整理せずに現場を開放してしまうことのリスクは大きくなっています。
よくある質問
中国のフィジカルAI向けデータファクトリーは何カ所ありますか?
虎嗅の独自集計では2026年8月時点で106拠点が確認され、うち84拠点が稼働しています。中国信通院の研究報告では、2026年6月末時点で建設・稼働済み70カ所超、建設中・計画中46カ所とされており、集計主体によって数字が異なります。
ロボットの学習データはいくらで取引されていますか?
虎嗅の業界調査では、実機ロボットによる遠隔操作データが1時間当たり約500〜1,000元、UMIなどロボット本体を使わない方式が約300〜400元、シミュレーション・合成データが約200〜500元です。ただし、有効な学習データの割合やモデル改善効果によって実質的な価値は大きく変わります。
日本企業が中国のデータファクトリーの動向から確認すべきことは何ですか?
自社の現場データを誰が所有し、どの範囲で二次利用・海外移転・競合利用されるのかを、ロボット導入やPoCの契約前に整理することです。現場でしか取れないデータは、フィジカルAI時代の交渉材料になります。
まとめ:中国の次の競争は何カ所作ったかではない
中国では、フィジカルAI向けの学習データ拠点が短期間で全国へ広がりました。虎嗅の独自集計では106拠点が確認され、84拠点がすでに稼働しています。しかし、施設の建設が進んだことで、むしろ次の課題が明確になりました。データを誰が継続購入するのか、異なるロボットで再利用できるのか、1時間当たりのデータ量ではなくモデル性能をどこまで改善できるのか、遠隔操作だけでなくEgo、UMI、シミュレーション、合成データをどう組み合わせるのか、という問いです。
中国のフィジカルAI産業は、データを集めればよいという第一段階から、どのデータに本当に価値があるのかを選別する段階へ入り始めています。日本企業にとっても、中国の施設数を追うだけではなく、自社が持つ現場、工程、作業ノウハウをフィジカルAI時代のデータ資産としてどう管理し、どの企業と組み、どの範囲まで共有するのかを検討する必要があります。
株式会社ロボットワークスは、中国フィジカルAI・ロボット領域に特化し、日本企業向けに市場調査・企業視察・企業ヒアリング・導入検討を支援しています。中国のフィジカルAI企業、データ収集企業、ロボットメーカーの動向調査、企業比較、現地ヒアリング、PoC・導入検討については、サービス内容をご覧のうえお問い合わせください。
中国フィジカルAI・ロボット領域の調査/視察をご検討の方へ
株式会社ロボットワークスは、中国・深センを拠点に、日本企業向けの市場調査、企業視察の設計・同行、中国企業へのヒアリング、導入検討支援を提供しています。中国のデータ収集企業・ロボットメーカーの動向調査や、自社現場データの扱いに関する契約条件の整理など、具体的な依頼内容が決まっていない段階でもご相談いただけます。
関連情報
- 1Xがワールドモデルに賭ける理由。家庭用ヒューマノイドNEOは「家事ロボット」ではなく、フィジカルAIのデータ端末なのか
- 中国のリアルデータ×AIとは?AIグラス・AIトイ・LBE・家政ロボット4事例
- WRC 2026 世界ロボット大会 現地レポート|出展373社で何が変わったか
参考出典
- 虎嗅/遍地开花的数采中心,开始批量露馅/2026年9月20日/https://www.huxiu.com/article/4892109.html
- 新華社/报告显示全国建成启用超70家具身智能训练场/2026年8月20日/https://www.xinhuanet.com/20260820/228dd736d7a84380ba1700bd34d5d79a/c.html
- 全国標準情報公共服務平台/高质量数据集 具身智能 面向训练基地的数据采集与模型训练规范(計画番号20262584-Z-907)/2026年4月24日下達/https://std.samr.gov.cn/gb/search/gbDetailedCNF?id=511E762CE9138008E06397BE0A0A41AF
- 全国標準情報公共服務平台/高质量数据集 具身智能 仿真合成数据生成与处理规范(計画番号20262583-Z-907)/2026年4月24日下達/https://std.samr.gov.cn/gb/search/gbDetailedCNF?id=511E762CE9128008E06397BE0A0A41AF
- 全国標準情報公共服務平台/人工智能 具身智能数据训练场建设指南(計画番号20255546-Z-469)/2025年10月21日登記/https://std.samr.gov.cn/gb/search/gbDetailed?id=41A934A216743FDBE06397BE0A0AC9DA
