脳波は物理AIの次のブレークスルーになるのか?

カリフォルニア州サンレアンドロの倉庫では、人間が脳波を測定しながらジェンガのタワーからブロックを引き出すという奇妙な実験が行われています。これはロボット工学における訓練データの取得方法の転換点を示しているかもしれません。

Share
Editorial illustration: A close-up of an EEG electrode array positioned over a robotic hand or mechanical arm, with delicate — MonstarX

脳波は物理AIの次のブレークスルーになるのか?

カリフォルニア州サンレアンドロの倉庫では、現在ロボット工学における最も奇妙な実験の一つが行われています。人間が慎重にジェンガのタワーから木製ブロックを引き出し、センサーが脳波を測定するというものです。神経科学ラボのセットアップのように聞こえるかもしれませんが、実はデータ収集作業です。そしてこれは、物理AIシステムがどのように訓練されるかについて、真の転換点を示しているかもしれません。脳波は物理AIの次のブレークスルーになるのか?この質問はSFのように聞こえますが、その背後にある工学的根拠は驚くほど説得力があります。

何が起きているのか

この実験は、AI モデル訓練用のデータツールを構築する企業Encordに属しています。TechCrunchのレポートによると、Encordは「パイロット」と呼ばれるロボット訓練者を雇用しており、彼らは計測ヘッドセットを装着しながら物理的なタスクを実行します。これらのヘッドセットはカメラを通じてトレーナーが見ているものを追跡するだけでなく、脳電図(EEG)データも取得し、リアルタイムで脳活動を測定します。ヘッドセットハードウェアは、脳信号から精神状態をデコードすることに焦点を当てたドイツの神経科学スタートアップZander Labsから提供されています。

基本的な考え方は、一度聞くと単純です。人間が器用さを要するタスクを実行するとき、すべての瞬間が同じ認知的重みを持つわけではありません。テーブルからカップを拾い上げることは簡単です。揺らぐジェンガのタワーから荷重を支えるブロックを抽出することはそうではありません。標準的なビデオ録画は両方の瞬間を同等のデータポイントとして扱います。脳波の読み取りはそうではありません。人間のオペレーターが注意の高まり、驚き、またはエラー修正を経験しているときを示します。この作業を監督するZanderの神経科学者Lucas Gehrkeは、任意の時点での脳活動の量が、最高レベルのモデルをいつ展開する必要があるかを理解しようとしているモデルビルダーに手がかりを提供すると説明しています。

Encordは現在、これをトライアルランとして扱っています。計画は、初期の脳波タグ付きデータセットを構築し、顧客のロボティクスモデルを通じて実行し、実際にパフォーマンスを改善するかどうかを評価してから、スケールアップするかどうかを決定することです。Encordのロボティクス責任者Vineeth Velmuruganは、これをロボティクスデータボトルネックを解決する取り組みの「最先端」と表現しています。そのボトルネック——モデルアーキテクチャではなく、計算でもなく、高品質な実世界の物理訓練データの単純な不足——は、真摯なロボティクスチームが直面する制約として急速に増加しています。

より広い文脈:最先端の物理AIモデルはYouTubeビデオからはうまく学習しません。複数のカメラアングル、密集した注釈、そして今では明らかに神経学的文脈が必要です。ロボティクスのデータ問題は言語モデルのデータ問題とは根本的に異なり、Encordは「データポイント」が何を意味するのかを再考する必要があると賭けています。

アジアにとって重要な理由

アジアは物理AI競争の傍観者ではありません。中国、日本、韓国、そしてますます東南アジアの製造ハブは、すべてロボット工学と自動化に深く投資しています。中国だけでもヒューマノイドロボット工学を国家戦略的優先事項にしており、工場の床用の二足歩行ロボットを構築する数十の資金が豊富なスタートアップがあります。日本の製造業セクターは、ほぼ誰よりも長く産業用ロボットを展開してきました。韓国の財閥は倉庫自動化に資本を注ぎ込んでいます。訓練データがどこから来るのか、そして誰がそれを制御するのかという問題は、これらのエコシステムのそれぞれに直接的な影響を与えます。

Encord-Zander実験は、アジアのテック開発者が注意深く注視すべき何かを指しています。物理AIの競争上の優位性はモデルの重みからデータパイプラインへとシフトしています。脳波注釈付き訓練データがロボットの器用さと意思決定を本当に改善する場合、そのデータを大規模に製造できるチームは、迅速に複製することが難しい構造的な利点を持つでしょう。データパイプラインはインフラストラクチャであり、インフラストラクチャの利点は複合します。

アジアのロボティクス企業にとって、これは脅威と機会の両方を生み出します。脅威:最高の物理AI訓練データがカリフォルニアの倉庫で生成されており、ヨーロッパの神経科学スタートアップによって構築されたツールを使用している場合、アジアの製造業者はハードウェアを構築する際にも西側のデータインフラストラクチャに依存するリスクがあります。機会:アジアは工場の床、倉庫操業、および製造密度を持っており、他の場所では本当に一致させるのが難しいスケールで物理訓練データを生成することができます。欠けていた部分は、それを適切に取得するための計測とデータツールです。

ロジスティクス、製造、またはラストマイル配送ロボティクスのためにAIの上に構築している東南アジアの起業家は、この開発を注視する必要があります。自分の運用環境を計測し、独自の物理訓練データを生成する方法を理解している企業は、Hugging Faceからダウンロードできないものを持つでしょう。

開発者にとっての意味

物理AI空間で作業している開発者——ロボティクスソフトウェア、訓練パイプライン、またはファウンデーションモデルの上に構築されたアプリケーションを構築しているかどうか——脳波のストーリーは、考える価値のある具体的なエンジニアリング上の影響をいくつか浮き彫りにします。

データ品質シグナルはデータ量よりも重要です。 Zander Labs統合の前提全体は、すべての訓練モーメントが等しくないということです。人間がタスクを完了する30秒のビデオクリップには、モデルが何か難しいことを学ぶ必要がある、本当に高いシグナルの瞬間が2、3個あるかもしれません。EEGデータは、これらの瞬間を自動的に識別する1つの方法です。しかし、基本的な原則——訓練データを正しく重み付けするために品質シグナルが必要であるということ——脳波センサーを使用しているかどうかに関わらず適用されます。物理AI応用のための訓練パイプラインを構築している場合、次のことを自問する必要があります。どのデータポイントが最も重要かをどのように知ることができますか?

注釈はマルチモーダルになっています。 ロボティクスの従来のデータ注釈には、ビデオフレームにオブジェクト位置、ジョイント角度、タスク状態をラベル付けすることが含まれます。神経学的データを追加することは、より広い傾向の極端なバージョンです。注釈はより豊かで、より層状で、より高価になっています。今日データパイプラインを構築している開発者は、拡張性のためにアーキテクチャを設計する必要があります。今設計する注釈スキーマは、スタックにまだ存在しないシグナルタイプに対応する必要があります。

センサー層は一流のエンジニアリング上の懸念になっています。 ソフトウェアAIでは、データはログ、ユーザーインタラクション、スクレイプされたWebコンテンツから来ます。物理AIでは、データは物理的な世界から来ます——そしてそのデータの品質はセンサーセットアップの品質によって制限されます。Encordパイロットは、アイトラッキングカメラとEEGセンサーを同時に備えたヘッドセットを装着しています。その計測を正しく、キャリブレーションし、大規模で信頼できるようにすることは、ほとんどのソフトウェア開発者が以前に考える必要がなかったハードウェア-ソフトウェア統合の問題です。物理AIに移行している場合、これは新しい「データインフラストラクチャ」問題です。

モデル効率はコンテキストに依存するようになります。 脳活動が認知的に要求の多い瞬間を示すときにのみ「最高レベルのモデル」を展開することについてのGehrkeのポイントは、直接的なエンジニアリング翻訳を持っています。すべての推論呼び出しが同じくらい高価である必要はありません。訓練データに難易度シグナル——神経学的またはその他——でタグ付けできる場合、より難しく考えるべき時を知っているモデルを訓練できます。これはロボティクスをはるかに超えて関連しています。推論コストが重要で、タスク難易度が異なるアプリケーションは、この種の適応計算割り当てから利益を得ることができます。

MonstarXの上に構築している開発者にとって、これはいくつかの実践的な設計上の考慮事項を提案しています。