Estimating Visibility of Annotations for View Management in Spatial Augmented Reality Based on Machine-Learning Techniques
要約
- 本文は、空間拡張現実(AR)における視認性推定に基づくビュー管理の可視性を提案している。
- これには、機械学習技術を使用して視認性を推定し、ラベルとリンクラインの可視性を分類するための特徴選択が含まれる。
- また、オンライン実験により、システムの判断が利用者の評価と一致する割合が76.0%であることが示されている。
- この研究の貢献は、機械学習ベースのビュー管理方法の提案と実装、ユーザーフレンドリーな可視性の定義、可視性分類特徴の提案、特徴部分集合の識別、およびオンライン実験の評価である。
この要約は、原文の主要なポイントを簡潔にまとめたものです。
- 他の仮想オブジェクト、ラベル、およびリンクラインとの重なり、およびリンクラインと他のリンクラインとの重なりを含むラベルの重なりを解決するために、コスト関数で異なるコストを割り当てる手法が提案されている。
- VR環境のビュー管理技術では、重なったラベルを見える領域に再配置するための手法が提案されている。
- 可視性の劣化を表す手法では、重なったラベルの面積や重なったリンクラインの長さ、リンクラインの長さなどが考慮されている。
- ラベルの配置技術では、投影ベースのARにおいて、投影面の幾何学的変形やテクスチャの影響をシミュレートして最適な位置を見つける手法が提案されている。
- 画像ベースの配置手法では、背景画像の分析に基づいて情報の適切さが決定され、可読性に影響を与える要因がいくつか提案されている。
- 可視性に基づくラベル配置システムでは、可視性を推定するためのアルゴリズムが提示されており、可視性の劣化を示す様々な要因が考慮されている。
- 物体表面にプロジェクターからの光が当たり、拡散反射、規則的(鏡面)反射、屈折による内部反射などが起こる。
- これらの反射光の合計は、ユーザーによって見えたり、カメラで捉えられる。
- 表面への投影が吸収率が高い場合、入射光はほとんど見えないが、金属や鏡などの高い鏡面反射率の表面に投影すると、規則的反射が優位になり、その方向からは見えるが他の方向からは見えない。
- さらに、透過光は規則的透過と拡散透過として現れ、他の表面で反射され、より複雑な外観を示す。
- 視認性クラスは、対象の認識の正確さと主観的な評価に基づいて離散クラスとして表され、ヒトの評価者によって付与される。
- 視認性クラスの推定器は、ラベルとリンケージラインのクラスについて別々に決定し、ラベルとリンケージラインの視認推定の組み合わせに基づいて候補位置の受容性を判断する。
- 視認性クラスの推定には、ラベルとリンケージラインそれぞれに対して88個と28個の特徴が定義される。
- 特徴計算の入力は、ラベルのRGB色、カメラと深度センサーから取得した生画像、ユーザーの視点、デバイスの位置、既存のラベルとリンケージラインの位置などである。
- プロジェクション領域は、システムによってレンダリングされたラベルとリンケージラインを実際にキャプチャする領域であり、ラベルのための投影領域はROIで表され、リンケージラインのための投影領域はセグメントの集まりで表される。
- これらの特徴は、ラベルとリンケージラインの特定の領域から計算され、コントラスト、明るさ、リンクの曖昧さ、不均一性、盲点の5つのクラスに分類される。
- フラクタル幾何学は自己相似性によって特徴付けられ、自然界において海岸線や山などで見られる。フラクタル次元(FD)はこの自己相似性の度合いを定量化するために利用される。また、ボックスカウンティング次元は、ROIの強度表面をカバーするキューブの数を数え、その値を二重対数グラフに対して最小二乗法で推定することによって近似的なフラクタル次元を測定する。
- 同様に、共起行列やランレングス行列から計算された特徴量が導入されることによって、方向性を捉えた特徴を取得する。共起行列特徴には、角度θにおける2点の存在確率を表す要素pθ(i, j)が含まれ、それに基づいて15の特徴が定義される。
- ランレングス行列からは、特定方向θにおける特定強度レベルiのランの長さjが定義され、これに基づいて5つの特徴が提案されている。
- これらを含め、合計46の明るさ特徴が得られる。また、不均一性特徴の計算においては、深度画像を用いて不均一性特徴が定義され、合計39の特徴が導入される。
- 盲点領域特徴は、盲点領域画像内のピクセル数(Nb)とROI内のピクセル数(N)の比率として定義される。
- リンクラインの領域の特徴は、3つのステップで計算され、セグメント特徴、セグメント特徴のシーケンス、リンクライン特徴が得られる。セグメント特徴および不均一性特徴が使用され、合計14のセグメント特徴が計算される。
- データセットの収集は、15人の視覚的に健康な人々による4種類のテーブルトップワークのオブジェクト構成をテストすることで行われ、訓練とテストのためのデータセットが生成された。
(9個の研究論文の一部の要約は以上です。)
- 評価者による口頭での回答や記録に続いて、実験者によるテーブルトップオブジェクトの提示が行われる。提示される情報は、5つの大文字の英数字とそのリンクラインを含むラベルで構成され、そのランダムな要素は文字の並び順、投影位置、リンクされたオブジェクト、ラベルとリンクラインの色である。色は赤、緑、青、黄、白から選ばれる。タスクごとに情報の提示、つまりラベルの位置と色、リンクラインの色がランダムに選択される。1セットのタスクは100個で、投影面上のオブジェクトの位置は各セットごとに変更される。各テーブルトップワーク条件では、評価者は2つのセットのタスクを体験する。データ収集システムは、色カメラと深度カメラからの画像を含む情報を記録する。これらの画像はそれぞれのタスクごとに保存され、合計8枚の画像から様々な投影条件の特徴が計算される。また、推定者の頭部の3次元位置が事前に測定される。推定者ごとに投影面の推定特徴とそれに対応する可視性のペアが800個収集され、120のテーブルトップオブジェクト構成から12,000のペアが使用される。タスク全体で可視性の客観的および主観的な評価が収集され、正しいテキストの認識とラベルとオブジェクトのリンクの正確さが可視性の客観的評価として使用される。ハードウェア構成は、RGBカメラとしてLogicool HD Pro Webcam C920、深度センサーとしてMicrosoft Kinect v2を使用し、投影機はEPSON EB1725を使用する。投影面の寸法は71 cm × 51 cmで、RGBカメラの解像度は960 × 720ピクセル(34.3 ppi)、深度カメラの解像度は286 × 216ピクセル(10.2 ppi)である。また、このシステムはセクション6.3で説明されているオンラインユーザー実験にも使用されている。5.2. バランスの取れたデータセットのためのデータ拡張では、盲点領域内と不均一な領域内から計算されたインスタンスの数が少ないことがわかった。そのた
- ラベルとリンケージラインのヒストグラム特徴量VARH、SKEWH、KURTHは情報量が少なく、特に高い周波数範囲のものは有用性が低い。
- 低い情報量がこれらの特徴が無価値であることを直接示すものではないと考えられる。
- ラベルの可視性クラスの過大評価のケースでは、低コントラストや透明な素材を通じて投影情報が伝達される状況がある。
- 特徴の式には改善の余地があると考えられる。
- 特徴選択により処理速度が改善された。
- システムのボトルネックは特徴の計算であり、特徴選択は全体の処理時間の削減に貢献した。
- リアルタイムのラベル配置のために特徴計算の処理時間を短縮する必要がある。
- オンライン実験による可視性分類器の評価では、ラベルとリンケージラインの混同行列が示された。
- ラベルの可視性クラスの分類性能は、選択された特徴によって0.919から0.913に低下した。
- リンケージラインの分類性能も、0.789から0.761に低下した。
- 特徴選択により処理速度が173%改善されたことが示された。
- システムの過大評価のギャップは76%であり、特徴が状況を効果的に表現していることが示された。
- 参加者の視点から見たラベルの配置とリンケージラインの評価が行われた。24%のラベル配置と27%のリンケージライン配置が誤って分類された。ラベルにおいて、過大評価が起こる可能性が過小評価よりも高い。過大評価は参加者の評価がシステムの判断よりも悪い状況であり、参加者がシステムの期待通りに快適に感じなかったことを示す。これは過小評価よりも重要である。表14は、参加者の評価がシステムの推定よりも低かった理由をまとめている。ラベルに関して、「−1」のギャップ値の最も一般的な理由は、提示されたラベルの変形とコントラストの低さによる読みにくさであった。
- ラベルの可視性の過大評価の理由は、主にガラスオブジェクトに関連しており、ガラスオブジェクトによる光の透過や屈折が影響していた。深度センシングの特性から、これらの状況を適切に評価することは困難である。
- リンケージラインにおいては、過小評価が主な誤った分類であり、参加者にとってシステムが期待していたよりも関連付けが正確で容易であった。システムの判断よりも低い評価の理由には、曖昧な注釈対象、投影面の不均一性によるラベルと対象の関連付けの困難さ、投影線の透過と屈折が含まれる。
- 本研究では、機械学習に基づいた空間拡張現実の視点管理手法が提案された。視認性に影響を与える要因の重み付け線形組合せが通常使用されるが、最適な重みの方法が示されておらず、既存のアプローチは、ラベルやリンケージラインの適切な位置を見つけようとするが、それがユーザーの視点から真に定義されておらず、ユーザーの行動をどのように感じ、期待されるかが明確ではない。問題に対処するために、機械学習技術を適用して、ユーザーの主観的および
- この論文の一部では、ユーザーインターフェイスソフトウェアとテクノロジーに関する14回目のACMシンポジウムでの研究成果について述べられている。
- テキストの読みやすさを予測するための識別可能性の測定についての研究が紹介されている。
- アウトドアでの拡張現実におけるテキストの視認性についての研究成果が記載されている。
- ヘッドマウントディスプレイにおけるモバイルテキストの管理に関する研究結果が提示されている。
- 可視性に焦点を当てた光学透過型ヘッドマウントディスプレイの情報配置方法について述べられている。
- 拡張現実向けの注釈のビュー管理に関する研究成果が紹介されている。
- テーブルトッププロジェクションによる拡張現実向けの情報配置に関する研究成果が紹介されている。
以上です。他にも要約が必要な部分があればお知らせください。
評価
この文書は、空間拡張現実(AR)における視認性推定に基づくビュー管理の新たな手法を提案しています。機械学習を用いて視認性を推定し、ラベルとリンクラインの可視性を分類するための特徴選択を行います。システムの評価はオンライン実験を通じて行われ、76.0%の一致率を示しています。この研究の主な貢献は、機械学習ベースのビュー管理方法の提案と実装、ユーザーフレンドリーな可視性の定義、可視性分類特徴の提案、特徴部分集合の識別、およびオンライン実験の評価です。
研究は、重なりや視認性の劣化を解決するための多くの手法を提案しています。これには、ラベルやリンクラインの重なりを解決するためのコスト関数、重なったラベルを再配置するためのVR環境のビュー管理技術、投影面の変形やテクスチャの影響をシミュレートするラベルの配置技術などが含まれます。さらに、視認性推定のためのアルゴリズムも提案されています。視認性クラスは、対象の認識の正確さと主観的な評価に基づいて定義されます。
この研究は、視認性クラスの推定器を提案しています。推定器はラベルとリンケージラインのクラスを個別に決定し、それらの視認推定の組み合わせを基に候補位置の受容性を判断します。対象となるラベルとリンケージラインの特徴はそれぞれ88個と28個で、これらはラベルの色やユーザーの視点など、様々な要素から計算されます。
特徴は、コントラスト、明るさ、リンクの曖昧さ、不均一性、盲点という5つのクラスに分類されます。視認性クラスの推定には、フラクタル次元やボックスカウンティング次元といった幾何学的な特徴や、共起行列やランレングス行列からの特徴などが用いられます。
さらに、明るさ特徴、不均一性特徴、盲点領域特徴、リンクライン領域特徴といった様々な特徴が導入されます。これらの特徴は、それぞれ特定の方法で計算され、結果として46個の明るさ特徴、39個の不均一性特徴などが得られます。
これらの詳細な特徴分析を通じて、システムは候補位置の視認性を精確に推定し、より効果的な情報提示を可能にします。
15人の視覚的に健康な人々がテーブルトップワークのオブジェクト構成をテストすることでデータセットが収集され、その中にはランダムな要素(文字の並び順、投影位置、リンクされたオブジェクト、ラベルとリンクラインの色)を含むラベルが提示される。これらの情報は色カメラと深度カメラで撮影され、それぞれのタスクごとに保存される。データ収集システムは、推定者の頭部の3次元位置を測定し、投影面の推定特徴とそれに対応する可視性のペアを収集する。このシステムは、RGBカメラ、深度センサー、投影機を使用して構成されている。また、データ拡張のために、盲点領域と不均一な領域からのインスタンスの数が増やされている。
ヒストグラム特徴量VARH、SKEWH、KURTHの情報量は少なく、高周波範囲のものの有用性は低いが、これが特徴が無価値であることを必ずしも意味しない。特徴計算がシステムのボトルネックであり、特徴選択による処理時間の短縮が求められる。オンライン実験では、選択した特徴によりラベルの可視性クラスとリンケージラインの分類性能が若干低下したが、処理速度は173%改善され、システムの過大評価のギャップは76%となった。参加者の視点からの評価では、ラベル配置とリンケージライン配置の一部が誤分類され、過大評価が過小評価よりも多かった。これは、参加者がシステムの期待通りに快適に感じなかったことを示す。ラベルの可視性の過大評価は主にガラスオブジェクトに関連し、光の透過や屈折が影響していた。また、リンケージラインでは過小評価が主な誤分類であり、参加者にとってシステムが期待していたよりも関連付けが正確で容易であった。
本研究は、機械学習を用いた空間拡張現実の視点管理手法を提案しています。これは、ラベルやリンクの最適な位置決定における問題を解決するためのもので、ユーザーの視認性と期待を考慮に入れた手法です。この研究は14回目のACMシンポジウムでも議論されています。また、テキストの読みやすさ予測のための識別可能性の測定、アウトドア環境におけるテキストの視認性、モバイルテキスト管理におけるヘッドマウントディスプレイ、光学透過型ヘッドマウントディスプレイの情報配置、拡張現実への注釈のビュー管理、テーブルトッププロジェクションによる拡張現実情報配置など、多岐にわたる拡張現実の視認性に関連するトピックについても取り上げています。
和訳
1 / 1
100%