スクリーンリーダーを使い慣れた人の合成音声を初めて聞くと、多くの人はその速さに驚く。言葉が一つ一つ流れるというより、情報が圧縮された帯のように聞こえることさえある。だが利用者にとって、読み上げ速度は単なる好みではない。仕事のメール、授業資料、ウェブ記事、操作メニューをどれだけ速く、しかも正確に理解できるかを左右する「情報処理速度」そのものだ。

問題は、その最適値が人によって大きく違うことだった。速ければ効率は上がるが、ある点を超えると理解が崩れる。遅すぎれば時間を失う。しかも、聞き取れなかった理由が「音声が速すぎた」のか、「文章自体が難しかった」のか、「利用者がまだ速い読み上げに習熟していない」のかを、従来の正答率だけではうまく分けられなかった。

産業技術総合研究所(産総研)人間社会拡張研究部門の三浦貴大 上級主任研究員、筑波技術大学の坂尻正次 教授ら、東京大学先端科学技術研究センターの藪謙一郎 特任研究員らの研究チームは、この問題に教育測定で使われる項目反応理論(Item Response Theory: IRT)を持ち込んだ。研究成果は9月25日に公表され、9月27日~10月1日にシドニーで開かれる国際会議Interspeech 2026で発表予定だ。[1][2]

11人視覚障害のあるスクリーンリーダー利用者が実験に参加
150~500語/分5段階の合成音声。実測では約6~27モーラ/秒
250~300語/分全体として理解度が大きく落ち始めた境界付近

「誰ができたか」だけでなく「問題がどれだけ難しかったか」を分ける

項目反応理論は、学力試験や資格試験、心理検査で広く使われる考え方だ。単純なテストでは、正答率が低い時、それが問題の難しさのせいなのか、受験者の能力のせいなのかが混ざってしまう。IRTは「項目の難易度」と「回答者の能力」を同じ尺度の上に置き、別々に推定する。

研究チームはこれを音声理解に置き換えた。ある文章を高速で読み上げて理解できなかった時、その失敗をすべて「本人の能力不足」とは見なさない。文章そのものの難易度と、読み上げ速度による難しさ、利用者の音声理解能力を統計モデルの中で切り分ける。

さらに今回はベイズ版の項目反応理論を採用した。対象者が限られる研究では大規模サンプルを集めにくい。ベイズ統計を組み合わせることで、少人数でも比較的安定した推定を行い、推定値だけでなく不確実性の幅も示せるという利点がある。[2]

毎分150語から500語——通常会話の約0.8~3.5倍

実験では、音韻的にバランスを取った日本語文章を集めたITAコーパスを使い、毎分150語、200語、250語、300語、500語の5段階で合成音声を作成した。実際の発話速度に換算すると約6~27モーラ/秒。通常会話のおよそ7~8モーラ/秒と比べると、約0.8倍から3.5倍に相当する。[2]

参加したのは、視覚障害があり、日常的にスクリーンリーダーを利用する11人。聞いた文章の内容理解に答えてもらうだけでなく、「聞き取りやすさ」「わかりやすさ」も評価した。

結果は直感的な部分と、そうでない部分の両方を含んでいた。速度が上がるほど文章理解の難易度は系統的に高くなった。毎分150語ではほぼ全問正答に近かったが、300語、500語へ上がるにつれ正答率は低下。全体として毎分250~300語付近が大きな境界になった。[2]

しかし「250語が正解」ではない

ここで研究の核心が出てくる。平均を見ると250~300語付近に理解の境界があったが、個人差は非常に大きかった。利用者間の能力差は、速度そのものがもたらす難易度差を上回るほどだったという。

つまり「視覚障害者向けスクリーンリーダーは毎分250語に設定すればよい」という結論ではない。むしろ正反対で、全員に同じ速度を当てる設計では、速い音声を十分理解できる人の能力を生かせず、逆にまだ習熟していない人には過剰な負担をかける可能性がある。

研究のポイントは「最適速度を一つ決めた」ことではない。
文章側の難しさと利用者側の理解能力を分けることで、一人ひとりに異なる最適速度を推定できる「ものさし」を作ったことにある。

全盲利用者は、弱視利用者より速い音声でも理解を保つ傾向

研究ではもう一つ興味深い差が見えた。全盲の利用者は、弱視(ロービジョン)の利用者に比べ、より速い読み上げでも高い理解を保つ傾向があった。

普段のスクリーンリーダー設定速度にも差があり、全盲利用者は標準速度の平均約2.3倍、弱視利用者は約1.4倍を使っていた。[2]

ただし、ここは慎重な解釈が必要だ。研究チームの分析では、この差は単純に「全盲の人は長く高速音声に慣れているから」とだけでは説明できず、視覚障害の状態と利用経験が、それぞれ独立して音声理解能力に関係する可能性が示唆された。

参加者は11人と小規模であり、「全盲なら必ず速く聞ける」「弱視なら遅い」という一般化はできない。研究者自身も、今後より多くの対象者で検証する必要性を明記している。[2]

なぜ高速音声が必要なのか——画面を「読む」代わりに「聞いて走る」

スクリーンリーダーは、画面上の文字や操作状態を合成音声に変換する。WindowsのNarrator、macOS・iOSのVoiceOver、NVDA、PC-Talkerなどが代表例だ。視覚に頼らずPCやスマートフォンを操作する人にとって、これは単なる読み上げソフトではなく、画面そのものへの入口である。[2]

晴眼者はウェブページを一字ずつ読まない。見出し、余白、色、位置を使い、必要な箇所へ一瞬で視線を飛ばす。スクリーンリーダー利用者は、その視覚的な「飛ばし読み」の一部を、キーボードショートカット、見出しジャンプ、ランドマーク移動、そして高速音声で補う。

そのため読み上げ速度は、単に「早口が好きか」の問題ではない。仕事で一日に数十通のメールを読む、長い仕様書を確認する、授業の資料を読む、ウェブを検索するといった場面では、1.5倍と3倍の差が一日の情報量を大きく左右する。

日本では約27万人が視覚障害の身体障害者手帳を所持

厚生労働省の「令和4年 生活のしづらさなどに関する調査」では、視覚障害の身体障害者手帳所持者は推計27万3,000人。手帳を持たない人や、加齢に伴う見えにくさまで含めれば、音声による情報アクセスを必要とする人はさらに多い。[6]

アクセシビリティは、文字を音声に変換できれば完成するものではない。読み上げ品質、ページ構造、操作のしやすさ、情報の探しやすさ、そして利用者ごとに調整できる速度まで含めて初めて、実用的な情報アクセスになる。

日本の福祉工学には長い「音声インターフェース」の歴史がある

今回の共同研究に名を連ねる東京大学先端科学技術研究センターの伊福部達 研究顧問は、約50年にわたり福祉工学を研究してきた。研究歴には、視覚障害者向けの「95リーダ」と呼ばれるスクリーンリーダー、超音波メガネ、触覚インターフェースなどが含まれる。[7]

この流れを見ると、今回の研究は「音声を出せるようにする」段階から、「その音声を人間がどれだけ効率よく理解できるかを測る」段階へ進んだものといえる。合成音声技術そのものが成熟したからこそ、人間側の認知特性と個人差が次の研究対象になる。

「理解度」と「聞きやすさ」は同じではない

この分野でもう一つ重要なのは、主観的に「聞きやすい」と感じる速度と、実際に内容を正しく理解できる速度が必ずしも一致しないことだ。

利用者は速い音声に慣れると、遅い音声を強いストレスと感じる場合がある。一方、速さを追求しすぎれば、聞こえているつもりでも内容理解が落ちる可能性がある。今回の研究では内容理解度に加えて、聞き取りやすさ、わかりやすさも評価したことで、「好み」と「理解」の両方を将来的な個別最適化へつなげられる設計になっている。

次の目標は、その場で「あなたの速度」を測るツール

研究チームは今後、より多くの視覚障害者を対象に調査し、推定精度を高める計画だ。特にスクリーンリーダーを使い始めて間もない利用者を追跡し、経験によって高速音声の理解能力がどのように伸びるのかを調べる。

さらに、短時間のテストからその人の音声理解能力を推定し、その場で適切な読み上げ速度を提示する評価ツールの開発を目指す。もし実用化されれば、OSやスクリーンリーダーの初期設定が「標準速度を選んでください」から、「数分のテストであなたに合う速度を推定します」へ変わる可能性がある。[2]

アクセシビリティの次の段階は「使える」から「効率よく使える」へ

デジタルアクセシビリティは、ウェブページが読み上げられるか、画像に代替テキストがあるかという最低限の適合性だけでは測れない。情報に到達できても、同じ仕事をこなすのに何倍もの時間がかかるなら、実質的な格差は残る。

今回の研究が面白いのは、その格差を「速度」という極めて日常的な設定から捉え直したことだ。読み上げを速くすればよいのではない。一人ひとりが理解を保ったまま最も効率よく情報を得られる点を見つける。そのための測定手法を作った。

合成音声の進歩は長らく「人間らしく話せるか」を競ってきた。スクリーンリーダーの世界では、別の問いが重要になる。人間らしくゆっくり話すことより、利用者が最速で正しく理解できること。その速度は、機械ではなく、一人ひとりの聞き手が決める。

編集上の注意:本研究は11人を対象にした初期的な実験であり、毎分250~300語を全利用者の推奨値とするものではない。全盲利用者と弱視利用者の差も、少人数の結果を一般化できない。研究チームは大規模調査と継続的な習熟評価を今後の課題としている。

出典・資料

  1. 科学技術振興機構(JST):合成音声読み上げ時の音声情報理解力を定量化(2026年9月25日)
  2. JST/産総研/筑波技術大学/東京大学:共同発表資料 PDF
  3. 産業技術総合研究所:合成音声読み上げ時の音声情報理解力を定量化
  4. 東京大学先端科学技術研究センター:研究成果
  5. 筑波技術大学:研究成果紹介
  6. 厚生労働省:令和4年生活のしづらさなどに関する調査
  7. 東京大学先端科学技術研究センター:伊福部達 研究顧問