巨大なゲノムデータを解析するには、巨大な計算機を一か所に置く――その前提を崩せるか。三井情報株式会社とNTTドコモビジネス株式会社は2026年10月5日、札幌から福岡まで全国5拠点に分散したGPUを使い、大規模ゲノムデータを並列処理する共同実証の結果を公表した。
使ったのは、NTTドコモビジネスが2026年7月に提供を始めた全国広域分散GPU実証環境「GPU over APN Testbed」。首都圏のストレージに約5TB、約170億レコードのゲノム変異データを置き、離れた5拠点のGPUへ処理を分散した。三つの検索・解析ユースケースで、5拠点分散時の処理時間は1拠点時の25~29%まで短縮した。
5TB、170億レコードを全国5拠点へ
実証では、首都圏側のストレージにVariant Call Format(VCF)のゲノム変異データを格納し、全国5拠点のGPUから解析を実行した。データはIGSRが公開する3,202人分で、約170億レコード、約5TB。IGSRによると、この3,202検体は1000 Genomes Projectのサンプル群を30倍程度の高カバレッジで再シーケンスしたデータセットに由来する。
ユースケースは三つ。特定の染色体領域に変異を持つ検体を探すこと、疾患リスクが知られた遺伝型を持つ検体数を集計すること、そしてがんの発症に関与することが知られているドライバー変異について220種類の変異を持つ検体を特定することだ。
134秒が33秒へ
結果は分かりやすい。ユースケース1では1拠点で134.4秒かかった処理が、5拠点分散では33.5秒。ユースケース2は99.9秒から28.6秒、ユースケース3は102.3秒から28.9秒へ短縮した。5拠点を使えば単純に5分の1、つまり20%になるわけではないが、実データに近い研究ワークロードで4倍前後まで高速化した。
| ユースケース | 1拠点 | 5拠点分散 | 比率 |
|---|---|---|---|
| 染色体領域の変異検体検索 | 134.4秒 | 33.5秒 | 25% |
| 疾患リスク遺伝型の集計 | 99.9秒 | 28.6秒 | 29% |
| 220種のドライバー変異検索 | 102.3秒 | 28.9秒 | 28% |
速度向上を支えたのは、GPUを増やしたことだけではない。三井情報はストレージアクセスなどのワークロード最適化技術と、ゲノム解析データの高速検索技術を提供した。巨大なVCFをどう分割し、どのGPUへ投げ、どこで結果をまとめるか。データ移動そのものがボトルネックになれば、遠隔GPUを増やしても速くならない。
なぜネットワークが主役になるのか
NTTドコモビジネスの「GPU over APN Testbed」は、札幌、金沢、大阪、福岡、首都圏4か所の計8拠点にGPUを配置し、IOWNのAll-Photonics Network(APN)で結ぶ。公表資料では100Gbps級の低遅延・高速大容量通信を使い、仮想マシンとKubernetesに対応、複数利用者がハードウェアを共有できるマルチテナント環境を想定している。
従来、GPUクラスタは同じデータセンターに近接配置するほど通信遅延を抑えやすい。だが生成AIブームでGPU需要が急増し、データセンター側の電力、冷却、ラック、受電容量まで制約になっている。高性能GPUを必要な数だけ同一地点へ集められないなら、ネットワーク側が距離を吸収する必要が出てくる。
IOWN APNは電気信号への変換を減らし、光のままデータを運ぶ領域を広げることで、低遅延・大容量・低ゆらぎ通信を狙うNTTの次世代ネットワーク構想の一部だ。NTTグループはすでに遠隔GPUを使ったAI映像解析や6Gを想定したIn-Network Computingでも実証を重ねている。
ゲノム解析は「分散GPU」の厳しい試験台
ゲノムデータは、生成AIとは異なる意味で計算基盤に厳しい。解析によっては、GPU演算だけでなく大量のストレージI/O、索引検索、データ転送が性能を決める。しかも研究が進めば検体数は増え、1人分の全ゲノムデータも高精度化する。
今回の実証が面白いのは、単にGPU間通信のベンチマークを取ったのではなく、実際の研究に近い検索処理を載せたことだ。データは一か所に置いたまま、計算を全国へ分ける構成は、「データを移すのか、計算をデータへ持っていくのか」という設計問題にもつながる。
1000 Genomesから始まった「共有ゲノム」の歴史
今回使われたIGSRデータの源流は、2008年に始まった国際共同研究「1000 Genomes Project」にある。世界各地域の人々の遺伝的多様性を大規模に公開し、研究者が共通の基盤データとして利用できるようにしたプロジェクトだ。2015年のPhase 3では2,504人を中心とするデータセットがまとめられ、その後New York Genome Centerが関連サンプルを含む3,202検体を高カバレッジで再シーケンスした。
公開データだからこそ、今回のような計算基盤の技術検証に使いやすい。逆に、実患者のゲノム情報には個人識別性、同意、アクセス制御、越境や施設間連携など、性能以外の要件が加わる。公開データで速かったから、そのまま医療現場へ持ち込めるわけではない。
日本でもゲノム医療の制度は動き出した
日本では2023年6月に「良質かつ適切なゲノム医療を国民が安心して受けられるようにするための総合的かつ計画的な推進に関する法律」、いわゆるゲノム医療推進法が公布・施行された。2025年11月には基本計画も策定され、研究と臨床の双方でゲノム情報を扱う環境整備が進んでいる。
制度が整えばデータ利用は増える。しかしデータが増えるほど解析基盤への負荷も増す。ゲノム医療のボトルネックは、シーケンサーの性能だけでなく、保存、検索、計算、ネットワーク、アクセス管理へ広がる。
「全国の空きGPU」を病院が使える日は来るか
両社は将来、全国の病院、大学、研究機関での研究活動とデータ利活用を支えることを目指すとしている。NTTドコモビジネスは、この知見をGPUaaSなどへ展開し、大規模AI処理基盤にも生かす方針だ。
ただし、病院が明日から全国のGPUを自由に束ねられるわけではない。実患者データを扱うなら、データをどこまで動かすのか、どの拠点が処理可能か、暗号化、認証、監査証跡、研究倫理、個人情報保護、障害時の責任分界などを詰める必要がある。今回の発表では、医療機関での本番運用条件や料金体系は示されていない。
- 分散拠点数を5からさらに増やした場合のスケーリング効率
- データ容量が5TBを大きく超えた場合のストレージ・ネットワーク性能
- GPU種類や拠点ごとの性能差をどう吸収するか
- 実患者データを扱う際のセキュリティ、同意、ガバナンス
- GPUaaSとして提供する場合の料金と、専用クラスタとの総コスト比較
- 停電・通信断・拠点障害時のジョブ継続性とデータ整合性
「巨大計算機を建てる」以外の選択肢
生成AIの普及で、GPUは研究室の部品から国家的なインフラ資源へ変わった。どこにGPUを置くかは、半導体の供給だけでなく、電力、土地、冷却、ネットワーク、地域分散まで含む問題になっている。
三井情報とNTTドコモビジネスの実証が示したのは、少なくとも特定のゲノム検索ワークロードでは、距離のあるGPUを束ねても高速化できるということだ。5拠点で処理時間が25~29%まで縮んだ結果は、その可能性を具体的な数字にした。
次の問いは速度ではない。高価なGPUを全国で共有する仕組みが、研究者にとって安く、使いやすく、安全で、再現性のある基盤になれるか。もしそこまで到達すれば、ゲノム研究の計算力は「どの研究機関が巨大クラスタを所有しているか」から、「必要な計算力へ誰がアクセスできるか」へ重心を移す。
出典・参考資料
- 三井情報株式会社・NTTドコモビジネス株式会社「全国広域分散GPUを活用した大規模ゲノム解析を共同実証」2026年10月5日。
- NTTドコモビジネス株式会社「IOWN APNを活用した全国広域分散GPU実証環境『GPU over APN Testbed』を提供開始」2026年7月6日。
- 厚生労働省「ゲノム医療について」—ゲノム医療推進法と基本計画。
- International Genome Sample Resource「3,202 samples at high-coverage from NYGC」2020年8月14日。
- NTT・NTTドコモ、IOWN APNと遠隔GPUを使うIn-Network Computing実証、2026年3月2日。
取材・確認期限:2026年10月6日午後1時21分(日本時間)。GPUの具体的な機種・台数、各拠点の個別構成、実患者データを用いた性能、セキュリティ設計、GPUaaSの料金、5拠点を超えるスケーリング性能は、公表資料では確認できない。
