実世界の人間の体験を、 Physical AI の学習データへ。
HOMIE Gen2 は、頭部装着型のマルチモーダル記録デバイスです。4基の広角カメラが装着者の周囲360°を捉え、映像・音声・深度・姿勢・慣性・言語アノテーションまでを同期した状態で記録します。ラボ環境を構築することなく、家庭・工場・店舗・屋外といった現実の環境でデータを集められます。 株式会社Nextremerは、Ropedia社(シンガポール)の国内窓口として、HOMIE Gen2 およびデータセットの提供を行います。
なぜ実世界データが必要か
ロボティクスや身体性を持つAIの学習では、外から人を観察したデータでは足りません。必要なのは、人が何を見て、どう動き、対象にどう働きかけ、その結果として世界がどう変化したかという一連のつながりです。
Ropedia はこれを 4Dデータ と呼んでいます。空間構造、動き、インタラクション、時間変化の4つを同時に含むという意味です。これを忠実に記録するには、体験が生まれる視点そのもの、つまり一人称視点から捉える必要があります。
一人称視点での記録はスケールします。外部設備を必要としないため、特定の実験室に依存せず、多様な環境と長い裾野の行動パターンを集められます。
HOMIE Gen2
概要
HOMIE は Human-centric OMni Interaction & Experience の略で、ハードウェアとソフトウェアを一体で提供するプラットフォームです。
ハードウェアの設計方針
- 軽量で装着負荷の少ない頭部装着形状
- 空間情報を捉えるマルチモーダルセンシング
- 自己運動の追跡と位置推定
- 長時間の屋外・現場記録に耐えるバッテリー
- 3D再構成の精度を担保するセンサー間同期
360°カバレッジ
広角カメラ4基が装着者の周囲360°を記録します。視線の先だけでなく、背後や周囲で何が起きているかも残ります。物理的な作業は単一方向で完結しないため、前方のみを撮る構成では失われる文脈が保持されます。
ソフトウェア(自動アノテーション)
記録したデータは、Ropedia の空間基盤モデル群によって機械可読な形式へ自動変換されます。
- 空間位置推定とステレオ深度推定
- 手と物体のインタラクション追跡
- 全身モーションキャプチャ
- パノラマシーン認識

仕様
- 外形寸法
- 300×240×138 mm
- 重量
- 380 g
- カメラ
- 4基
- 映像解像度
- 1920×1088 @30fps
- 映像フォーマット
- MP4
- カメラ画角
- 水平162°・垂直109°
- IMU
- 200 fps
- Bluetooth
- Bluetooth 5.2(BR/EDR・BLE)
- 内蔵マイク
- デジタルMEMS 4基
- ストレージ
- microSDカード(最大2TB)
- ブザー
- 状況別の通知音
- 外部ポート
- USB Type-C ×1(データ)、USB Type-C ×1(フル機能)、PPSポート ×2
- 電源入力
- 5V DC
- バッテリー
- 3.6V 3000mAh リチウム電池(内蔵)
- 連続動作
- 録画最大90分 / 待機約4時間
- Wi-Fi
- Wi-Fi 5(IEEE 802.11 a/b/g/n/ac)2.4GHz・5GHz帯
提供オプション
01
HOMIE Gen2 ハードウェア
ローカルのデータストレージとマルチモーダルセンシングを備えた HOMIE Gen2 ヘッドセットを提供します。現実の環境で記録を始めるために必要なものがすべて揃っています。
02
HOMIE Gen2 + ハードウェア管理
ハードウェア管理プラットフォームにより、Gen2 に遠隔からのデバイス管理機能が加わります。デバイスの状態監視、OTA によるファームウェア更新の配信、さまざまな環境に分散した複数台のデバイスの同期管理が行えます。
03
HOMIE Gen2 + ハードウェア管理 + データ収集スイート
記録からデータ化までを、ひとつのスタックで提供します。
データ収集管理プラットフォーム
記録タスクをデバイスへ配信し、アップロードされた記録を受け取ってレビューし、データパイプライン全体を一元管理します。
データ収集アプリ
HOMIE Gen2 に接続して割り当てられた記録タスクを受け取り、現場から直接録画を操作します。
Xperience Enterprise
概要
Xperience Enterprise は、身体性AIの研究開発に向けた大規模な一人称視点データセットです。現実の9種類のシーンカテゴリにわたって、同期した広角映像・IMU・深度・姿勢・意味ラベルとともに記録した、マルチモーダルなアノテーションを提供します。
- シーン数
- 5,000
- 有効記録時間
- 100,000h
- シーンの種類
- 9
- モダリティの層
- 8
シーン分布
| シーン | 割合 | 有効記録時間 |
|---|---|---|
| 家庭・住居 | 30.0% | 30,000h |
| 工場・物流倉庫 | 20.0% | 20,000h |
| スーパーマーケット・コンビニエンスストア | 20.0% | 20,000h |
| 医療・介護(病院・高齢者介護) | 5.0% | 5,000h |
| ホテル | 5.0% | 5,000h |
| レストラン・カフェ | 5.0% | 5,000h |
| 教育 | 5.0% | 5,000h |
| 屋外(駐車場・キャンパス) | 5.0% | 5,000h |
| オフィス | 5.0% | 5,000h |
有効記録時間に占める割合
- シーン
- 家庭・住居
- 割合
- 30.0%
- 有効記録時間
- 30,000h
- シーン
- 工場・物流倉庫
- 割合
- 20.0%
- 有効記録時間
- 20,000h
- シーン
- スーパーマーケット・コンビニエンスストア
- 割合
- 20.0%
- 有効記録時間
- 20,000h
- シーン
- 医療・介護(病院・高齢者介護)
- 割合
- 5.0%
- 有効記録時間
- 5,000h
- シーン
- ホテル
- 割合
- 5.0%
- 有効記録時間
- 5,000h
- シーン
- レストラン・カフェ
- 割合
- 5.0%
- 有効記録時間
- 5,000h
- シーン
- 教育
- 割合
- 5.0%
- 有効記録時間
- 5,000h
- シーン
- 屋外(駐車場・キャンパス)
- 割合
- 5.0%
- 有効記録時間
- 5,000h
- シーン
- オフィス
- 割合
- 5.0%
- 有効記録時間
- 5,000h
モダリティ
| モダリティ | 説明 | 仕様 |
|---|---|---|
| 広角映像 | HOMIE で記録した生の映像 |
|
| IMU(生データ) | HOMIE で記録した生のIMU信号 |
|
| 音声 | HOMIE で記録した生の音声 |
|
| 平行化ピンホール映像 | 前方2台のカメラ映像を、前向きの2本のピンホール映像に平行化したもの |
|
| カメラ姿勢 | HOMIE の映像から得た SLAM 姿勢と生のIMUデータ |
|
| 深度 | ステレオ映像から算出した深度 |
|
| 手のモーションキャプチャ | ワールド座標系での手の位置 |
|
| キャプション | 映像内の行動を自然言語で記述したもの |
|
同期した8種類のモダリティ。センサー間のハードウェア同期誤差は50 μs未満です。
- モダリティ
- 広角映像
- 説明
- HOMIE で記録した生の映像
- 仕様
- 160°の広角レンズ
- 広角映像4本で360°をカバー
- 1920 × 1088 @ 30 fps
- グローバルシャッター
- モダリティ
- IMU(生データ)
- 説明
- HOMIE で記録した生のIMU信号
- 仕様
- 6自由度
- 200 Hz
- 映像と同期
- モダリティ
- 音声
- 説明
- HOMIE で記録した生の音声
- 仕様
- 4チャンネルの空間音声
- サンプリングレート 44.1 kHz
- 16ビット
- モダリティ
- 平行化ピンホール映像
- 説明
- 前方2台のカメラ映像を、前向きの2本のピンホール映像に平行化したもの
- 仕様
- 1920 × 1088 @ 30 fps
- ピンホールカメラモデル
- モダリティ
- カメラ姿勢
- 説明
- HOMIE の映像から得た SLAM 姿勢と生のIMUデータ
- 仕様
- 30 fps
- 3次元位置
- 4次元回転(クォータニオン)
- モダリティ
- 深度
- 説明
- ステレオ映像から算出した深度
- 仕様
- 1920 × 1088 @ 30 fps
- 平行化した左ピンホール映像と位置を合わせて出力
- モダリティ
- 手のモーションキャプチャ
- 説明
- ワールド座標系での手の位置
- 仕様
- 30 fps
- 片手あたり21キーポイント
- MANO 手モデル
- モダリティ
- キャプション
- 説明
- 映像内の行動を自然言語で記述したもの
- 仕様
- メインタスク:映像全体の上位の目的
- サブタスク:数十秒から数分続く段階
- 現在の行動:約60フレーム続く人の基本動作
品質
すべてのパイプラインを測定し、すべてのバッチを検証しています。主な指標には、測定範囲と母数を併記しています。
| パイプライン | 指標 | 値 | 測定条件・母数 |
|---|---|---|---|
| SLAM(カメラ姿勢) | 位置誤差(MAE) | 1.02 cm | 6 m の移動 |
| SLAM(カメラ姿勢) | スケール誤差(MAPE) | 0.241%(最悪値 0.503%) | 巻尺で実測した 6.000 m の移動・5回反復 |
| 深度 | 距離誤差 | 4回の撮影すべてで 2.5% 未満(0.35% / 0.84% / 1.06% / 2.16%) | 4回の撮影・距離 0.38–1.27 m・n=1,876(観測数) |
| 手のモーションキャプチャ | 関節位置誤差(PA-MPJPE) | 4.68 mm(フレーム単位)/ 5.41 mm(シーケンス単位) | 手の21関節・有効シーケンス12本 |
| キャプション | 物体の正解率(Object Accuracy) | 99.6% | n=1,017 |
| キャプション | 現在の行動の正解率(Current Action) | 96.0% | n=321 |
| キャプション | 動作開始時刻の平均絶対誤差(Action-onset MAE) | 0.208 s | n=24 |
検証日:2026年8月5日
- パイプライン
- SLAM(カメラ姿勢)
- 指標
- 位置誤差(MAE)
- 値
- 1.02 cm
- 測定条件・母数
- 6 m の移動
- パイプライン
- SLAM(カメラ姿勢)
- 指標
- スケール誤差(MAPE)
- 値
- 0.241%(最悪値 0.503%)
- 測定条件・母数
- 巻尺で実測した 6.000 m の移動・5回反復
- パイプライン
- 深度
- 指標
- 距離誤差
- 値
- 4回の撮影すべてで 2.5% 未満(0.35% / 0.84% / 1.06% / 2.16%)
- 測定条件・母数
- 4回の撮影・距離 0.38–1.27 m・n=1,876(観測数)
- パイプライン
- 手のモーションキャプチャ
- 指標
- 関節位置誤差(PA-MPJPE)
- 値
- 4.68 mm(フレーム単位)/ 5.41 mm(シーケンス単位)
- 測定条件・母数
- 手の21関節・有効シーケンス12本
- パイプライン
- キャプション
- 指標
- 物体の正解率(Object Accuracy)
- 値
- 99.6%
- 測定条件・母数
- n=1,017
- パイプライン
- キャプション
- 指標
- 現在の行動の正解率(Current Action)
- 値
- 96.0%
- 測定条件・母数
- n=321
- パイプライン
- キャプション
- 指標
- 動作開始時刻の平均絶対誤差(Action-onset MAE)
- 値
- 0.208 s
- 測定条件・母数
- n=24
単位および参照基準はパイプラインごとに異なります。
データ生成の流れ
01
Sense
HOMIE Gen2 で同期記録
02
Engine
マルチモーダルデータの整列・整理・処理(アノテーション+QCエンジン)
03
Deliver
学習投入可能な状態で納品
活用イメージ
世界モデル
一人称の体験データは、環境がどう変化し、行動がどう結果に結びつくかの現実的な軌跡を提供します。実際の知覚と相互作用に基づく学習により、物理的な予測と推論の精度が上がります。
Real2Sim
シミュレーションの有効性は、アセットの現実性に規定されます。人間の体験データは、自然な動作パターン、接触の物理、タスクの分布といったシミュレーションが取りこぼしがちな要素を補い、より代表性のある訓練環境を作ります。
VLAモデル
大規模な一人称データは、Vision-Language-Action モデルに対し、人が実際にどう知覚し、行動し、タスクを言語化するかを与えます。新しいタスク・指示・環境への汎化に効きます。
価格・お見積もり
HOMIE Gen2・データセットとも、ご要件に応じた個別のお見積もりとなります。デバイスは導入台数と提供オプション、データセットは提供範囲と用途によって構成が変わります。
お見積もりに際して、以下をお知らせいただけると初回のご回答が早くなります。
- HOMIE Gen2
- 導入予定台数、利用環境、提供オプション(01〜03)のご希望
- データセット
- 想定している用途、必要なシーンカテゴリ、想定データ量、希望納期
お問い合わせ
国内窓口として
株式会社NextremerはRopedia社の国内窓口として、日本語での技術的なご相談、日本円建てでのお取引、導入後の国内サポートを提供します。
世界モデル、ロボティクス、身体性AIエージェントの開発に取り組まれていて、実世界の人間の体験データを必要とされている場合は、ぜひご相談ください。