AI音声インタビュー
音声によるAIインタビューを、リアルタイムの文字起こしとともに実施します。
AI音声インタビューでは、回答者はタイピングの代わりに音声で回答できます。AIがリアルタイムの音声会話を進行し、適応型のフォローアップ質問と自動文字起こしを行います。
手順
- 音声AIインタビューまたはユーザビリティテストを追加アンケートエディターで+ 追加をクリックし、AIインタビューを選択して、どのように実施しますか?で音声を選択します。画面共有を使ったガイド付きタスク形式のセッションにする場合は、代わりにユーザビリティテストを選択します。
- 音声設定を行うインタビューのトピック、AIのパーソナリティ、システムプロンプトを設定します。セッションモードは、柔軟性とコスト管理に優れたパイプライン(STT・LLM・TTSの各コンポーネントを個別に使用)と、レイテンシーを最小限に抑えるリアルタイム(OpenAIまたはGoogle Geminiのネイティブなマルチモーダルモデルを使用)から選択できます。新規に作成するパイプライン方式の音声インタビューでは、会話モデルとしてClaude Sonnet 5が既定で使用されます。既存のアンケートでは、保存済みのモデルがそのまま使用されます。希望するTTS・STTプロバイダーを選択してください。時間ベースの音声インタビューでは、時間のプリセット(1、2、3、5、10、15、20、30、45、60分)から選ぶか、任意の時間を入力できます。
- 文字起こしを確認回答者が音声インタビューを完了すると、文字起こしが自動的に生成され、音声の録音データとともに「結果」タブで確認できます。
AI音声インタビューはタイピングの手間をなくし、回答者が自然な会話を通じて、詳細でニュアンスに富んだフィードバックを伝えやすくします。
セッションモードは2種類あります。最大限の柔軟性を持つパイプライン(STT+LLM+TTSの各コンポーネントを個別に使用)と、レイテンシーを最小限に抑えるリアルタイム(OpenAIまたはGoogleのネイティブなマルチモーダルモデルを使用)です。
音声合成(TTS)プロバイダー:Cartesia Sonic-3/3.5(推奨、レイテンシー約40ミリ秒、多言語対応)、ElevenLabs(v3、Flash v2.5、Turbo、Multilingual)、Deepgram Aura-2、Rime Arcana(表現力豊かな声で高速な英語対応)、xAI TTS(20言語対応、インラインの発話タグ)、Inworld TTS(インタラクティブな用途向けの豊かな感情表現)など。リアルタイムモードでは、OpenAIとGoogle Geminiが音声処理をネイティブに行います。
音声認識(STT)プロバイダー:Deepgram Flux(音声エージェント向けに推奨、ターン検出機能を統合)、Cartesia Ink Whisper(最速、80以上の言語に対応)、AssemblyAI Universal-3 Pro(プロンプトで専門用語に対応可能)、Deepgram Nova-3(WER6.84%で最高精度、36言語対応)、ElevenLabs Scribe V2 Realtime(99以上の言語に対応、単語単位のタイムスタンプ付き)。
アバター対応:TavusまたはLemonSliceを使って、音声インタビューにビジュアルのAIアバターを追加できます。回答者にとって話しかける相手の顔が見えるため、長めのインタビューでもエンゲージメントが高まります。音声設定で用意されているプリセットのアバターから選択できます。
ガイド付きユーザビリティテスト:AI音声インタビューはガイド付きユーザビリティテストモードに対応しており、回答者はウェブサイトやアプリ上でステップごとのタスクを完了し、AIモデレーターが画面共有を通じて観察します。タスクシナリオ、タイムバジェット、ウォームアップタスク、思考発話(think-aloud)のプロンプト、タスク順序のカウンターバランスを設定できます。詳しい設定方法はユーザビリティテストガイドをご覧ください。
料金:パイプラインモードは1分あたり約US$0.05です。OpenAI Realtimeは1分あたり約US$0.30、Google Gemini Realtimeは1分あたり約US$0.08です。
標準搭載の音声強化機能(ai-coustics)は、ボイスフォーカスと話者分離を適用し、騒がしい環境でも文字起こしの精度を向上させます。適応型の割り込み処理は、咳や相槌といった誤った割り込み(バージイン)を機械学習によって除外します。
文字起こしはすべての音声インタビューで自動的に生成されるため、音声データであっても分析が簡単に行えます。