shii·haa breath detection: スマートフォンのマイクによるライブ・バイオフィードバック
shii·haa breath detectionシステムは、スマートフォンのみのマイクを使用して、吸気、呼気、および息止めといった呼吸フェーズを推定することで、リアルタイムのバイオフィードバックを提供します。このアプローチにより、ウェアラブルセンサーや外部のコーチを必要とせずに、ユーザーが自身の呼吸パターンの自己認識を高めることが可能になります。
検出パイプラインの技術アーキテクチャ
システムは、ノイズの多い現実世界のモバイルオーディオ信号から呼吸パターンを抽出するために、3層の信号処理パイプラインを採用しています。
1. 信号処理
生のオーディオストリームは、短く重なり合うウィンドウに分割されます。各ウィンドウに対して、システムは振幅/エネルギー測定値とスペクトル特徴を導出します。検出ロジックは、スペクトルの形状に基づいてフェーズを区別します。吸気は通常、より多くの乱気流と高い周波数エネルギーを示し、呼気はより低く、滑らかになります。
2. 呼吸状態マシン
不規則なフェーズの切り替えを防ぐため、システムは現在のフェーズと妥当な遷移(例:吸気 $\to$ 呼気)を追跡する状態マシンを使用します。このマシンは、周囲のノイズレベルが変動するにつれて再校正される適応型しきい値を利用しており、オーディオ信号の一時的なスパイクが誤ったフェーズ変更をトリガーしないようにしています。
3. データ品質層
精度を確保するため、データ品質層は、ノイズが多すぎる、音が小さすぎる、または音響的に曖昧なウィンドウを拒否します。システムは「誠実に失敗する」ように設計されており、これは、確信を持って誤ったフェーズ検出を提供するよりも、短い不確実な期間を設けることを好むことを意味します。
プライバシーとオンデバイス処理
プライバシーは、shii·haaシステムの設計における核心的な制約です。パイプラインは以下の制限事項に基づいて構築されています:
- オンデバイス分析: すべてのオーディオ処理は電話機上でローカルに行われます。生のオーディオストリームがデバイスを離れることはありません。
- 音声分析なし: システムは呼吸のエネルギーエンベロープとスペクトル形状を分析するものであり、言語的な内容を分析するものではありません。音声(スピーチ)を認識したり文字起こししたりするように設計されていません。
- 限定的な機械学習: MLは、ブラックボックス的な検出エンジンとして機能するのではなく、フィードバックを洗練させ、品質チェック済みの例を使用してモデルを改善するためにのみ使用されます。
ガイド付き呼吸への応用
単純な検出を超えて、システムは呼吸信号をフィードバック・チャネルとして使用し、ガイド付き呼吸をよりパーソナライズされたものにします。ユーザーの実際のペースと安定性を検出することで、アプリは固定されたタイマーに頼るのではなく、ユーザーの生理学的状態に合わせてプリセットを適応させることができます。
長期的には、このプロジェクトは「個人の共鳴範囲」を推定することを目指しています。これは、個人の生理機能が最も効果的に落ち着く特定の低速呼吸ペース(多くの場合、1分間に6回の呼吸に近いもの)を指します。これは、検出された呼吸の安定性と、オプションの心拍数またはHRVデータと組み合わせることで達成されます。
実装の課題と限界
システムの開発には、モバイルオーディオ特有の挙動(自動ゲイン制御(AGC)やマイクの配置の変動など)を扱うための、多大なエンジニアリングの努力が必要でした。著者は、制御されていない環境におけるマイクのみの検出は、ウェアラブルベースのシステムよりも大幅に難しいと述べています。
コミュニティ・フィードバックと洞察
コミュニティのユーザーや開発者は、実装に関していくつかの点を指摘しています:
"マイク単体では私のケースでは不十分であり、検出がかなり困難でした。結局、マイク付きの有線イヤホンを使用することにしました。"
これは、スマートフォンからきれいな呼吸信号をキャップチャリングすることは技術的に困難な課題であるという、コミュニティのコンセンサスを強調しています。他のユーザーは、ドイツやオランダにおけるアプリの地域的な利用可能性の問題についても言及しています。
プロジェクトのステータス
これはウェルネスおよび自己認識のためのツールであり、医療機器ではありません。開発者は現在、システムの正確な精度と限界を決定するために、臨床的なグラウンド・トゥルース(正解データ)に対する検証研究を行っています。