心臓病患者への説明にAIを活用:ChatGPT、Claude、DeepSeekの比較研究
心臓病の治療において、患者さんが自身の病状や治療法について正確に理解し、納得して治療を選択することは非常に重要です。そのためには、分かりやすく質の高い患者教育資料が不可欠となります。近年、急速に進化している人工知能(AI)の一種である大規模言語モデル(LLM)は、このような医療情報の生成に活用できる可能性を秘めています。しかし、AIが生成する情報が本当に患者さんにとって読みやすく、正確で、信頼できるものなのかについては、まだ多くの懸念が残されています。
今回ご紹介する研究は、ChatGPT、Claude、DeepSeekという3つの主要なLLMが、心臓病患者向けの教育資料をどの程度効果的に作成できるかを比較したものです。この研究は、AIが医療現場でどのように役立つか、そしてどのような点に注意が必要かを知る上で、非常に重要な示唆を与えてくれます。
💡 AIが医療説明を変える?大規模言語モデルの可能性
研究の背景と目的
心臓病の患者さんが、自身の病気や治療について十分な情報を得た上で意思決定を行うことは、質の高い医療を受ける上で欠かせません。そのため、医療従事者は患者さんに対して、病気や検査、治療に関する情報を分かりやすく提供する必要があります。しかし、多忙な医療現場において、個々の患者さんに合わせた教育資料を迅速かつ効率的に作成することは、大きな負担となることがあります。
ここで注目されるのが、ChatGPTに代表される大規模言語モデル(LLM)です。LLMは、大量のテキストデータを学習することで、人間が書いたような自然な文章を生成する能力を持っています。この技術を患者教育資料の作成に応用できれば、医療従事者の負担を軽減しつつ、より多くの患者さんに質の高い情報を提供できる可能性があります。
しかし、AIが生成する医療情報には、「読みやすさ」「情報の質」「臨床的な正確性」「最新のエビデンス(科学的根拠)に基づいているか」といった点で懸念が指摘されています。誤った情報や理解しにくい情報が提供されれば、患者さんの健康に悪影響を及ぼす可能性もゼロではありません。
本研究は、これらの懸念を解消するため、ChatGPT、Claude、DeepSeekという3つの異なるLLMを比較し、一般的な心臓画像診断に関する患者教育資料の作成能力を多角的に評価することを目的としています。
🔬 どのように評価したのか?研究方法の詳細
評価対象のAIモデルと医療処置
この研究では、以下の3つの大規模言語モデル(LLM)が評価対象となりました。
ChatGPT (OpenAI社製)
Claude (Anthropic PBC社製)
DeepSeek (DeepSeek Artificial Intelligence Co., Ltd.製)
これらのLLMを用いて、以下の3つの一般的な心臓画像診断手技に関する患者教育資料が生成されました。
1. 心臓磁気共鳴画像法 (CMR):磁気と電波を使って心臓の詳しい画像を撮影する検査です。
2. 冠動脈CT血管造影 (CTCA):X線と造影剤を使って冠動脈(心臓に血液を送る血管)の状態を詳しく調べる検査です。
3. 侵襲的冠動脈造影 (ICA):カテーテルと呼ばれる細い管を血管に入れて、冠動脈の詰まり具合や狭窄を直接調べる検査です。
各LLMが3つの手技ごとに資料を生成したため、合計9つの患者教育資料が評価されました。
評価項目と測定方法
生成された9つの資料は、以下の4つの主要な側面から評価されました。
1.
読みやすさ(Readability)
患者さんが資料をどれだけ容易に理解できるかを測る指標です。以下の複数の評価ツールが用いられました。
Flesch-Kincaid Grade Level
Gunning Fog Index
Simple Measure of Gobbledygook (SMOG)
Flesch Reading Ease (フレッシュ・リーディング・イーズ):数値が高いほど読みやすいことを示す指標です。
その他、単語数や文数も測定されました。
2.
情報品質(Information Quality)
資料に含まれる情報の信頼性や質を評価しました。
modified DISCERN (mDISCERN) ツール:医療情報の信頼性、質、バランスの取れた内容であるかを評価するためのツールです。
3.
ガイドライン遵守度(Guideline Adherence)
資料の内容が、関連する専門学会や患者教育リソースが推奨する最新のガイドラインにどれだけ従っているかを評価しました。
研究者によって開発されたチェックリストが使用されました。
4.
専門家による臨床評価(Expert Clinical Assessment)
実際に臨床経験を持つ専門家が、資料の臨床的な正確性や有用性を評価しました。
2名の独立したレビューア(評価者)が、構造化された16点満点の採点システムを用いて評価を行いました。
これらの評価項目について、3つのLLM間で統計的な比較が行われ、それぞれのモデルの性能が詳細に分析されました。
📊 どのAIが優れていたのか?主要な研究結果
この研究で得られた主要な結果を以下の表にまとめました。各評価項目において、3つのAIモデル(ChatGPT、Claude、DeepSeek)がどのような性能を示したかが一目で分かります。
| 評価項目 | ChatGPT | Claude | DeepSeek | 統計的有意差 (p値) | 主な傾向 |
|---|---|---|---|---|---|
| Flesch Reading Ease (読みやすさ) (高いほど読みやすい) |
50.70 ± 7.88 | 60.93 ± 5.51 | 70.73 ± 1.74 | p = 0.027 (有意差あり) | DeepSeekが最も読みやすい |
| mDISCERNスコア (情報品質) (高いほど質が高い) |
3.50 ± 0.50 | 2.67 ± 0.29 | 3.83 ± 0.29 | p = 0.061 (有意差なし) | DeepSeekが最も高いが、統計的有意差はなし |
| ガイドライン遵守度 (%) (高いほどガイドラインに沿っている) |
91.54 ± 3.39 | 88.07 ± 6.48 | 89.33 ± 3.41 | p = 0.702 (有意差なし) | ChatGPTが最も高いが、統計的有意差はなし |
| 専門家による臨床評価スコア (高いほど臨床的に優れている) |
15.67 ± 0.58 | 14.33 ± 0.58 | 16.00 ± 0.00 | p = 0.067 (有意差なし) | DeepSeekが最も高いが、統計的有意差はなし |
| 総単語数 | (データ省略) | (データ省略) | (データ省略) | p = 0.027 (有意差あり) | モデル間で単語数に有意差あり |
※数値は平均値 ± 標準偏差を示します。
主要な結果のまとめ:
読みやすさ: DeepSeekが最も優れた読みやすさのプロファイルを示しました。Flesch Reading Easeスコアが最も高く、統計的にも有意な差がありました。これは、DeepSeekが生成した資料が、他のモデルに比べて一般の読者にとって理解しやすいことを意味します。
情報品質: DeepSeekはmDISCERNスコアでも最も高い平均値を示しましたが、この差は統計的に有意ではありませんでした。しかし、DeepSeekが質の高い情報を生成する傾向にあることが示唆されます。
ガイドライン遵守度: ChatGPTが最も高いガイドライン遵守度を示しましたが、この差も統計的に有意ではありませんでした。全てのモデルが高い遵守度を示しており、最新の医療情報に基づいた内容を生成できることが分かります。
専門家による臨床評価: DeepSeekが専門家による臨床評価スコアで満点(16.00 ± 0.00)を達成し、最も高い評価を得ました。これも統計的に有意な差ではありませんでしたが、DeepSeekの資料が臨床現場で非常に有用であると評価されたことを示しています。
単語数: 総単語数にもモデル間で統計的に有意な差が認められました。これは、各モデルが異なる長さの資料を生成する傾向があることを示しています。
全体として、DeepSeekは読みやすさ、情報品質、専門家による臨床評価において最も好ましい結果を示しました。一方、ChatGPTはガイドライン遵守度で優れていました。全てのモデルが心臓画像診断に関する高品質な患者教育資料を生成できる可能性を秘めていることが明らかになりました。
💡 研究結果から見えてくること:AI活用の考察
各AIモデルの強みと弱み
今回の研究結果から、各AIモデルが患者教育資料の生成において異なる特性を持っていることが明らかになりました。
DeepSeek: 最も優れた「読みやすさ」を示し、さらに「情報品質」と「専門家による臨床評価」でも最高のスコアを達成しました。これは、DeepSeekが生成する資料が、患者さんにとって理解しやすく、かつ内容も信頼性が高く、臨床現場で役立つ可能性が高いことを意味します。特に、専門家評価で満点を獲得したことは注目に値します。
ChatGPT: 「ガイドライン遵守度」で最も高いスコアを示しました。これは、ChatGPTが最新の医療ガイドラインや推奨事項に沿った正確な情報を盛り込む能力に優れていることを示唆しています。
Claude: 全体的に見て、他の2つのモデルに比べてスコアがやや低い傾向にありました。しかし、それでも一定の品質の資料を生成できることは示されています。
AI生成コンテンツの現状と課題
この研究の最も重要な発見の一つは、今回評価された3つのLLM全てが、一般的な心臓画像診断手技に関する「高品質な」患者教育資料を生成できた、という点です。これは、AIが医療現場で患者教育を支援する強力なツールとなり得ることを示しています。
しかし、同時に重要な課題も浮き彫りになりました。研究結果によると、全てのモデルが生成したコンテンツは、推奨される患者のヘルスリテラシー基準よりも高いレベルで作成されていました。
ヘルスリテラシー:健康に関する情報を理解し、評価し、活用することで、健康的な意思決定を行う能力を指します。
つまり、AIが生成した資料は、一般の患者さん、特にヘルスリテラシーが低い方にとっては、まだ少し難解である可能性があるということです。
このことから、AIが生成した資料をそのまま臨床現場で導入する前には、以下の点が不可欠であると結論付けられています。
専門家によるレビュー: 医療従事者や専門家が、生成された資料の内容を最終的に確認し、正確性や適切性を保証する必要があります。
読みやすさの最適化: 患者さんのヘルスリテラシーレベルに合わせて、資料の言葉遣いや構成を調整し、より分かりやすくするための最適化作業が求められます。
AIは強力な「補助ツール」として、医療従事者が患者教育資料を作成するプロセスを効率化し、質の向上に貢献できる可能性を秘めていますが、最終的な責任と調整は人間の専門家が担うべきである、という点が強調されています。
🏥 私たちの生活にどう役立つ?実生活へのアドバイス
この研究結果は、患者さんと医療従事者の双方にとって、AIが医療情報提供にどのように関わってくるかを示唆しています。
患者さんへのアドバイス
AI情報を鵜呑みにしない: インターネット上やAIが生成した医療情報は、あくまで参考情報として捉えましょう。必ず医師や看護師などの医療従事者に相談し、確認することが最も重要です。
不明な点は積極的に質問する: 医療資料や説明で分からないことがあれば、遠慮せずに医療従事者に質問しましょう。理解できるまで説明を求める権利があります。
複数の情報源を参照する: 医療に関する情報を得る際は、一つの情報源だけでなく、信頼できる複数の情報源(学会のウェブサイト、公的機関の資料など)を参照することをお勧めします。
ご自身のヘルスリテラシーを意識する: 難しいと感じる情報があれば、より簡単な言葉で説明を求めたり、図やイラストを使った資料をリクエストしたりするなど、ご自身の理解度に合わせて情報を得る工夫をしましょう。
医療従事者へのアドバイス
AIを「補助ツール」として活用する: AIは、患者教育資料のドラフト作成や情報収集の効率化に非常に有用です。ゼロから資料を作成する手間を省き、より多くの時間を患者さんとの対話に充てることができます。
最終的なレビューは必須: AIが生成した資料は、必ず専門家が内容をレビューし、臨床的な正確性、最新性、そして患者さんの状況への適合性を確認してください。
読みやすさの最適化を意識する: 患者さんのヘルスリテラシーレベルに合わせて、専門用語を避けたり、平易な言葉に置き換えたり、視覚的に分かりやすいレイアウトにしたりするなど、読みやすさの調整を積極的に行いましょう。
個別化された情報提供: AIを活用して資料作成の効率を上げ、その分、個々の患者さんの疑問や不安に寄り添った、より個別化された情報提供やカウンセリングに力を入れることができます。
AIは医療現場に大きな変革をもたらす可能性を秘めていますが、その利用には常に人間の専門家による慎重な判断と介入が不可欠です。AIと人間が協力することで、より質の高い患者教育が実現できるでしょう。
⚠️ 限界と今後の課題
本研究は、AIが患者教育資料生成に貢献する可能性を示す一方で、いくつかの限界と今後の課題も浮き彫りにしています。
本研究の限界点
特定の医療処置に限定: 今回の評価は、心臓磁気共鳴画像法 (CMR)、冠動脈CT血管造影 (CTCA)、侵襲的冠動脈造影 (ICA) という3つの心臓画像診断手技に限定されています。他の疾患や治療法に関する資料生成において、同様の結果が得られるかは不明です。
英語での評価: 研究は英語で実施されており、日本語を含む他の言語でのAIの性能や、文化的な背景を考慮した資料生成能力については評価されていません。
AIモデルのバージョン進化: 大規模言語モデルは急速に進化しており、研究実施時点のバージョンと現在のバージョンでは性能が異なる可能性があります。
評価者の主観性: 専門家による臨床評価には、ある程度の主観性が含まれる可能性があります。
ヘルスリテラシーの個別評価の欠如: 生成された資料が「推奨される患者ヘルスリテラシー基準よりも高い」と指摘されていますが、個々の患者のヘルスリテラシーレベルを詳細に評価したわけではありません。
今後の課題
多様な疾患・治療法への適用: 今後は、より広範な疾患や治療法(例:糖尿病、がん、精神疾患など)における患者教育資料生成へのAIの適用可能性を評価する必要があります。
多言語対応と文化適応: 英語以外の言語での資料生成能力や、各国の文化や医療システムに合わせた情報提供の最適化が求められます。
リアルタイムでの情報更新: 医療情報は常に更新されるため、AIが最新のエビデンスに基づいた情報をリアルタイムで反映できるか、そのメカニズムを確立することが重要です。
個別化された教育資料の生成: 患者さんの年齢、教育レベル、ヘルスリテラシー、特定のニーズに合わせて、より個別化された教育資料をAIが生成できるような技術開発が期待されます。
倫理的・法的側面: AIが生成した医療情報に関する責任の所在、データのプライバシー保護、誤情報によるリスクなど、倫理的・法的な側面についても議論とガイドラインの策定が必要です。
医療従事者との協調: AIを単なるツールとしてではなく、医療従事者との協調作業を通じて、より効果的な患者教育を実現するためのワークフローやトレーニングの開発が求められます。
これらの課題を克服することで、AIは医療現場における患者教育の質と効率を飛躍的に向上させる可能性を秘めていると言えるでしょう。
まとめ
今回の研究は、ChatGPT、Claude、DeepSeekといった大規模言語モデル(LLM)が、心臓病患者向けの教育資料作成において非常に有望なツールであることを示しました。特にDeepSeekは、読みやすさ、情報品質、そして専門家による臨床評価の点で優れた性能を発揮し、ChatGPTはガイドライン遵守度で高いスコアを記録しました。
しかし、全てのAIモデルが生成した資料は、推奨される患者さんのヘルスリテラシー基準よりもやや難解であるという重要な課題も明らかになりました。このことから、AIは患者教育資料作成の強力な「補助ツール」として活用できるものの、臨床現場で導入する前には、必ず医療専門家による内容のレビューと、患者さんが理解しやすいように読みやすさの最適化を行うことが不可欠です。
AIの進化は目覚ましく、今後もその性能は向上し続けるでしょう。AIと人間の専門家が協力し合うことで、患者さん一人ひとりに寄り添った、より質の高い医療情報提供が実現される未来が期待されます。
関連リンク集
日本循環器学会: https://www.j-circ.or.jp/
国立循環器病研究センター: https://www.ncvc.go.jp/
厚生労働省: https://www.mhlw.go.jp/
日本医学会: https://jams.med.or.jp/
PubMed (論文検索データベース): https://pubmed.ncbi.nlm.nih.gov/
書誌情報
| DOI | 10.7759/cureus.115285 |
|---|---|
| PMID | 42801264 |
| PubMed URL | https://pubmed.ncbi.nlm.nih.gov/42801264/ |
| 発行年 | 2026 |
| 著者名 | Iram Tooba Fatima, Abdullah Haroon, Begum Naazira, Begum Suraiya, Antlee Shaheed |
| 著者所属 | Cardiac Critical Care, CARE Hospitals, Hyderabad, IND.; Emergency Medicine, Mythri Hospitals, Hyderabad, IND.; Pathology, King Salman Bin Abdulaziz Medical City, Madinah, SAU.; Dermatology, King Salman Bin Abdulaziz Medical City, Madinah, SAU. |
| 雑誌名 | Cureus |