HoloLens の共同発明者である Avi Bar-Zeev が共有する: 全天候型 AR メガネへの道
全天候型 XR メガネへの道
30 年以上にわたり、XR、メタバース、および空間コンピューティングに取り組んできました。これには、10 の異なる XR ヘッドセット プロジェクトの支援または助言が含まれます。 チームが 10 億ドルを費やして構築する前に、主に要件を証明または否定し、主要なユーザー エクスペリエンスを定義することによって、さまざまなプロジェクトに早い段階で貢献することができました。 その過程で、何が機能し、何が機能しないかについての教訓を学びました。 場合によっては、「まだ成熟していない」というのが正解です。
私は、私の以前の雇用主がまだ専有と見なしている情報を開示しません。 いくつかの洞察を得ることができる公開された特許へのリンクを提供します。 信じようと信じまいと、それが特許の実際の目的です。 もちろん、憶測を招きそうな特許は避けます。
私が言ったり書いたりすることを、会社の製品計画の証拠と見なしたり、誰かの努力を批判したりしないように注意することが重要です。 これは私の意図ではありませんでした。
背景として、私が構築した最初の実際の XR エクスペリエンスは CAVE でした。 当時、私は 250 ドル000のコンピューターと巨大なプロジェクターを借り、さらに 30 ドル000を原材料に投資しました。 100 ドルのディズニーの VR ヘッドセット000は 90 年代に製造されましたが、商業市場には出ませんでした。000 重量を支えるためにケーブルを天井から吊るす必要がありますが、何十万人もの人々が試しています。
2010 年 1 月までに、すぐに使える消費者向け XR メガネの開発を開始できるようになることを願っています。 この動きの遅いフィールドで大きな水しぶきを上げる時が来ました。 さらに、Google Glass と Magic Leap も同時期に登場しました。 幸いなことに、Microsoft のインキュベーション チームで受けたタスクの 1 つは、次世代の XBox に関する新しいアイデアを見つけることでした。
Xboxの幹部は当時、「『これはクレイジーだ』と言わせるほど攻撃的になろう」と語った。
私は確かに「過激な」アイデアを持っています。 私たちの小さなチームはすぐに、すべてのスクリーンを 1 つのスクリーンに置き換えるという新しい製品コンセプト「スクリーン ゼロ」に取り組み始めました。 私は技術的な調査を担当し、最初の形成年に経験を定義するのに役立ちました. 私の退職理由は、この記事のスペースに値しません。 しかし、1,000 人以上が参加した後、HoloLens は 2016 年に発売されました。
これは画期的な装備です。 しかし、それはまだ全天候型の消費者向けウェアラブルではありません. 今日の Magic Leap 2、Snap Spectacles、Varjo、Quest のいずれもありません。
では、一日中装着できる AR メガネを実現するには、具体的に何が必要なのでしょうか?
1. マキシマリズムとミニマリズム
HoloLens が最終的に採用したような最大主義のアプローチは、多数のセンサー、アルゴリズム、および電力をハイエンド システムに統合することを指します。 エンジニアリングとユーザー エクスペリエンスが決まれば、理論的に絞り込むことができます。 しかし、それにはさらに時間がかかり、特定の電子機器が電力を最適化するだけで最大 10 年かかる場合があります。
Cambria や同様のデバイスも同様に最大主義であり、巨大な不透明な VR ディスプレイと複数のカメラで AR をシミュレートし、現実とシミュレーションの混合をピクセル単位で正確に制御します。 Maximalism は、ハイエンド アプリケーションとコア R&D に最適です。 アプリケーションがより産業的であっても、現時点で機能する唯一のツールであると主張する人もいます。
しかし、今日市場に出回っている最も高価なデバイスでさえ、一日中装着することはできず、通常の社会的交流や路上を安全に歩くことさえできません. ホログラフィックやライト フィールド ディスプレイなどのマキシマリスト機能はまだ成熟していません。
一方、ミニマリスト アプローチのデバイスには、Amazon Echo Frames、Snap Spectacles、Ray-Ban Stories などがあります。 それらは、ウェアラブル グラスのフォーム ファクターの現在の制約内に収まるテクノロジのみを詰め込み、多くの場合、ディスプレイを完全に捨てます。
それでも、ディスプレイのないメガネは XR としてカウントできますか?
それが自分の状況の視点を強化するなら、私はそう言うでしょう. ポッドキャストや音楽ミックスは XR ではありません。ユーザーや現在の環境をまだ感知していないからです。 GPS ナビゲーション アプリは多少はマッチしますが、十分ではありません。 AI とピンポイント ポジショニングのために空間オーディオとカメラを追加すると、ディスプレイがなくても、間違いなく XR としてカウントされます。
ミニマリストのアプローチは、短期的により多くの製品を販売することができ、通常は特定の側面に焦点を当て、それをクラス最高のソリューションにします. ウォークマンやiPhoneのようにうまくやれば、数十億ドルで売ることができます。 しかし、ミニマリズムは簡単だとは思わないでください。多くの点で、うまくやるのは難しいからです。
2. 最良の方法
私は、XBox の Screen Zero がミニマリストのメガネとマキシマリストのコンソールのハイブリッドであることを望んでいました。 AR メガネは、オークリーのメガネと同じか、それよりも小さいサイズにする必要があります。 次のホストは、同じ部屋で最大 4 組のメガネを扱うための重労働のほとんどを行います。
3. 人間工学、エネルギー消費、熱
なぜ分離するのですか? それはエネルギー消費、より正確には熱です。
コンピュータのすべての作業は最終的に熱の形で行われ、他の作業には光子や音などの機械的駆動が含まれる場合があります。 どのくらいの熱? 軽量の AR メガネは、約 1 ワットのエネルギーを生成できます。
一般的なスマートフォンは、約 10 ワットを生成してから加熱することができます。 ホストまたは PC は、スマートフォンの 10-100 倍のエネルギーを消費する可能性があるため、メガネの 100-1000 倍のエネルギーを消費します。 小さな LED 懐中電灯や巨大な衣類乾燥機を考えてみてください。 これはエネルギー消費量の大きな違いです。
エネルギー消費のバランスを取るには、データ フュージョン、分割レンダリング、最適化されたレンダリング ストリームなど、私が 2010 年から取り組んできたものと同様のソリューションが必要です。 低帯域幅の場合、視線追跡ベースのタイム ワーピング レンダリングが適切に機能し、通信遅延をカバーします。
CPU、カメラ、ディスプレイ、RAM は多くのエネルギーを消費し、多くの熱を発生します。 したがって、秘訣は、ほとんどの場合、控えめに使用することです。 低電力のカスタム ハードウェアを考えてみてください。新しいコンテキスト センサー、超低電力ディスプレイ、巧妙に「起動」するアルゴリズムなどです。
これは解決するのに時間がかかります。 たとえば、光学式マウスとホスト コントローラーがスタンバイ状態でない場合、それらのバッテリーは消耗するため、テザー ソリューションから始めます。 現在、光学式マウスは小さなバッテリーで数か月使用できます。
4. リビングの外
さまざまなユースケースをサポートするために、光学的に透明な AR システムは、明るい環境 (窓や居間の照明でさえも) からの光を理想的に遮断し、空間オーディオをより適切にパーソナライズして現実と混合し、光学フォーカスを調整し、他の仮想ホログラムをキャプチャして再現する必要があります。もっと。
デバイスが本体とヘッドセットに分かれていても、頭の中にはまだ「もの」が多すぎます。 人間工学上の大きな課題は、ほとんどの XR デバイスがまだ使用している巨大なストラップを取り除くことです。これにより、ヘッドセットが顔に抱きつくバグのように見えます。
張力を必要とするあらゆる種類のストラップは、ユーザーベースの多様性を制限し (頭のサイズのバリエーションと髪を台無しにしやすいことを考慮して)、メガネを着用する可能性を減らします. つまり、全天候型の機器は超軽量で、一般的に通常のメガネと同じようにフィットする必要があります。
多くの場合、Oakley のメガネ以下のサイズにすることは、システムの多くをクリップまたはリモコンに移動することを意味します。 Magic Leap はそのようなクリップを提供します。 XR デバイスがネックバンド セットアップを使用していることに気付きました。これは、消費者の首にコンピューティング コンポーネントをぶら下げることを意味します。 この分割設計により、別々の作業を行うほど、アイ/ヘッド アセンブリを軽量化できます。
2010 年、私は個人的に上腕二頭筋にもっと興味を持っていました。 これにより、重くて高温のコンポーネントを頭と首から遠ざけ、熱を放散する表面積が大きくなります。 腕にあるバイオセンサーは、Meta が Control plus Labs デバイスを使用して手首からジェスチャーを読み取る方法と同様に、ジェスチャーを検出することもできます。 このように、製品設計者は依然として「ケーブルなし」と言えます。
5. フォーカス
多くの成人が近見視力と遠見視力を矯正する必要があるため、終日装着可能なフォーム ファクターは、多くの場合、現実世界を拡大して焦点を合わせる必要があります。 少なくとも、これは、レンズがカスタム ビジョン パラメーター光学系をサポートする必要があることを意味します。 Snapが以前に買収した導波路会社は、関連する光学系を機能的な視覚レンズに埋め込む計画を発表しましたが、それは困難でした.
しかし、視覚パラメータは 1 つだけで十分でしょうか? 多くの成人は、読書や運転 (遠視) のためだけに眼鏡が必要です。つまり、さまざまな状態に切り替えるために眼鏡が必要です。 では、高価なメガネが 2 つか 3 つ必要なのでしょうか? それとも、見る場所に応じて光を曲げる二焦点、三焦点レンズですか? (実用的ですが、理想的ではありません)
私が推進している解決策の 1 つは、動的な光学調整です。これにより、同じメガネで読書や運転をサポートし、細かい文字や遠くの標識を拡大することさえできます。 これにより、より多くの友人が簡単に試すこともできます。 XBox がシングル プレイヤー ゲームのみをサポートしていて、部屋に 2 人か 3 人の友達がいると想像してみてください。 ちょっとがっかり。
現在の最良のダイナミック フォーカシング方法には、Alvarez (メカニカル スライド) と液体で満たされた調整可能なレンズが含まれます。 機械的なソリューションは、信頼性を低下させる傾向があります。 特別な LCD を積み重ねたり、焦点を電子的に変更したりするために、かなりの量の研究開発が行われています。 メガはその仕事を引き受けるために会社を買収しました。
次に、現在の視線に基づいて虚像の焦点を合わせるという問題があります。 Avegant と Magic Leap は、単純なライト フィールド表示をシミュレートして、2 つの焦点距離をすばやく切り替える方法を示しました。これは、翼幅内の適切な焦点距離で「仮想オブジェクト」をナビゲートするために重要です。 これまで、焦点距離を連続的にスキャンする方法をいくつか調べてきましたが、市販のモニターは実際には十分な速度ではありません。
目を追跡すると、処理が容易になり、計算負荷が軽減され、より自然なユーザー入力が提供されます。 私は視線追跡の問題に精通しており、意思決定者にリスクを早い段階で警告しています。
最後に、ビジネス面では、Luxottica は低価格で高価格のアイウェアを販売することで多くの利益を上げています。 それは今日の市場、そしてあなたが知っているほとんどのアイウェアブランドを支配しています. XR メガネの企業は、彼らと協力するか反対するかを決めなければならず、どちらも簡単な選択ではありません。 Meta は、Ray-Ban メガネを開発するために彼らと協力することを選択しました。 同社の競合相手には、Warby Parke やその他の小規模企業が含まれます。 優れた流通チャネルとパートナーがいなければ、優れた新製品を販売することはできません。
6.コントラスト
Magic Leap 2 は、自然界を選択的にぼかす方法を提供します。 私は 2010 年からこの問題に取り組んできましたが、まだ完全な解決策はありません。 一連の光学エンジニアは、それが必要だとは考えていませんでした。 理由は次のとおりです。
透明な「加算」ディスプレイが「黒」をレンダリングできない理由は、一般的に理解されています。 黒の場合は RGB{{0}},0,0。これは実際には何も追加せず、既存の光では見えません。 ただし、明るい領域に近づくと、簡単にだまして黒や影を認識させることができます。
XR メガネを屋外に持っていき、明るい日光に照らされた壁 (おそらく暗い場所や日陰の近く) を見ると、非常に難しい問題が発生します。 特定の領域は、他の領域よりも 1000 ~ 10000 倍明るい場合があります。 屋内ではコントラストが非常にはっきりしているため、AR ビジュアルは実に恐ろしく見えます。 光学エンジニアは、これを克服するには、より多くの光を出力する必要があるとよく主張します。 彼らの光学系は通常、わずか 1 パーセント -10 パーセントの効率しかありません。つまり、ほとんどの光は目に入らず、熱を加えるだけです。 熱は最大の制限要因の 1 つであるため、光学系だけを中心にシステムを設計することはできないことを思い出してください。
現実には、透明な AR またはビデオ シースルー グラスは、視覚的な強化を行う際に実際のシーンを考慮する必要があります。 透明度の場合、目的の最終的な色を得るために、実際の照明から眼鏡を差し引く必要があることがよくあります。 ビデオ パースペクティブの場合、ディスプレイはピクセル全体を置き換えることができますが、仮想 3D シーンの透明度は、カメラから読み取った背景色と混合する必要があります。 つまり、基本的に見ているのは、透明または不透明な高エネルギーカメラと回路です。 これは、目を遮りながらエネルギーと重量を追加するため、設計上の大きな制約となります。
表面的には、透明なガラスを使用した選択的なシェーディングは、ディスプレイに電力を追加したり、カメラを追加したりするよりも安価です。 2010年、導波管の前にシンプルなモノクロ液晶を配置。 期待どおりに機能し、3D ソリッド オブジェクトを柔らかい黒い輪郭でレンダリングします。 ただし、動的キャリブレーションの必要性などの欠点があり、LCD は実際の光を歪めます (主に制御ワイヤの屈折)。 それ自体ではダイナミックレンジが貧弱です。 屋外では、ほぼ 100% の不透明度が必要になる場合があります。 屋内、特に社交の場やテレプレゼンスでは、人を直接目で見ることができるように透明性を高めたいと考えています。
このアプローチに対する主な反論は、LCD やその他の空間光変調器は、目から 1 インチ離れたところで焦点が合っていないことが多いということです。 しかし、歪みは適切なプラスとマイナスの透明なARディスプレイといくつかの高速で低電力のセンサーを備えたものであり、サングラスは他の場所の視界を暗くすることなく日光、まぶしさ、ヘッドライトを遮断できます. 世界を微妙に暗くして、おすすめの本をキラキラに見せることができます。 より高度な減算 (フィルタリング) を使用すると、メガネは世界の色を変更したり、暗視を強化したり、落ち着きがなかったり気が散ったりしたときに生体認証フィードバックを提供したりすることさえできます。
いろいろなデモ用のものを作り、より良い方法を探すのに長い時間を費やしました。 しかし、それらにはすべて特定の欠点があります。 しかし、Magic Leap 2 の実装により、コアの問題が解決されるという希望が持てます。
7. ネットワーク
無線もエネルギーを必要とするため、分割システムには常にトレードオフがあります。 最も有望な未来は、ハイエンドの無線周波数を使用して、現在よりも低電力と高帯域幅を実現することです。 しかし、主な課題は、この周波数が皮膚や壁を (良くも悪くも) 通過できないことです。 そのため、無線波が部屋や人々の周りで跳ね返ったりビームを発したりするため、解決策は非常に巧妙である必要があり、現在よりも多くの送信機を使用する必要があるかもしれません. 明らかに、これによりコストと複雑さが増します。
終日ウェアラブルの場合、ネットワークに依存する製品を販売する前に、ネットワークが利用可能である必要もあります。 この制限が、私が提唱する分割レンダリング ソリューションを企業がリリースしない最大の理由です。 5G は私たちが必要としているものに近づいていますが、少なくとも米国では、これにより遅延が少なくなり、同時にネットワークを使用する人が増えるという問題がほぼ解決されます。 5G以上が必要ですが、良いスタートです。
部屋の元の「ホスト」 (または類似のもの) を取り除き、小型で軽量なフォーム ファクターを維持するには、プライバシーを侵害しない方法で組み合わせて、コンピューティングを「エッジ」化する方法が必要です。 バイオメトリック センサー データをエッジまたはクラウド ソリューションに送信することは、簡単に悪用される可能性があるため、誰にとっても非常に懸念されます。
8. カメラ
カメラをメガネに取り付けるのは難しいものです。 Google Glass は、社会的受容において多くの過ちを犯しており、広範な攻撃を受けています。 しかし、スナップはその点でほとんど問題を抱えていないようです。 同時に、Facebook は、おそらく私たちが好むと好まざるとにかかわらず、よりパーソナライズされた広告を配信するために、すべての人の生活の詳細を把握することに取り組んでいます.
一部のカメラは、3D シーンのデジタル化や人や物のデジタル オクルージョンなど、エネルギーを大量に消費します。 3D グラフィックスを適切に配置するには、空間内で頭を継続的に追跡する必要があり、カメラは依然として主要なソリューションです。 IMUセンサーを活用することで、エネルギー消費を増やしています。
写真やビデオの撮影は、他のデバイスよりも自然で便利な場合は特に、かなり人気のあるユース ケースです。 ただし、サイズと電力の制約により、写真の品質は一般的なスマートフォンの品質よりも低くなります。 フレームに小さな白色光を提供するだけでは、社会的承認という複雑な問題を解決するには不十分です。
シーンの理解は、他の人の写真を撮る必要がないこともあり、カメラ グラスの主な機能として想像しやすいですが、より重要なことは、1 日中メガネを着用することの最も重要な新しいユース ケース、つまり状況の理解を可能にすることです。
9. 経験
2010 年に私が最も開発したいと考えている R&D は、強力なアイ トラッキング機能とボディ トラッキング機能をサポートする AR メガネであり、PC やマウスの従来の「四角形の中の四角形」を超えて、より自然な空間コンピューティング ユーザー インターフェイスを探求します。 ハードウェアには確かに限界がありますが、XR が広く採用されるには、将来「どのように」対話するかという経験的な問題に誰かが取り組む必要があります。 「ボックス内の3Dボックス」は明らかにそうではありません。 そのため、まだやるべきことがたくさんあります。
Meta は、いわゆる「ビジュアル チューリング テスト」に合格することに VR の取り組みを集中させていますが、1 日を通して着用できる XR メガネは、他のものよりも便利である必要があります。 多くの人は、AR レイヤーまたはチャネルが私たちの現実に浸透し、目にするものすべてをマークし、情報を追加し、3D で空間ストーリーを伝え、世界を再描画すると想像しています。 これはオンデマンドである可能性が高いですが、それは私が期待する日常の経験ではありません.
ほとんどの場合、人々は頻繁に行うことを改善したいと考えています。コミュニケーション、ナビゲート、身の回りの世界の発見、場所の理解と変更、買い物、コンテンツの体験、仕事からの収入などです。 成功するためには、XR メガネがスマートフォンやその他のデバイスよりも優れた性能を発揮する必要があります。
スマホではできないこと。 焦点を動的に調整し、光を選択的に遮断する通常のメガネを想像してみてください。 テキストを入力したり、口頭で尋ねたりしなくても、彼らは積極的かつ個人的にあなたと話すことができます. それだけで数十億ドルの製品になります。 このようなメガネは、日々の経験の一部として物事を記憶したり、信頼できる推奨事項を提供したりするのに役立ちます (プッシュ広告に対して)。
この分野で私が行った最も重要な研究は、非視覚的 XR メガネを使用した非同期通信です。 今日のスマートフォンの音声とテキスト機能は十分に優れていますが、集中するのに苦労しているときはわかりますか? 仕事や遊びの流れを維持するために、適切なタイミングでコンテキストを切り替えるのに役立ちますか? メガネが輝く場所は次のとおりです (メーカーを信頼できると仮定します)。
私が説明したことはすべて非常に難しく、関連するテクノロジーはほとんど存在しません。 まだミニマリストの軌道には乗っていませんが、それは光学系の小型化と視野の最大化を優先していないためです. しかし、次のような質問をすると、どのような XR メガネが成功し、他社が成功しなかったのでしょうか? 上に挙げたものはすべて、優れた製品を構築するのに役立つと思います。
