動画で話したこと

動画では、不眠と不安が重なっていた人で、認知機能の障害や認知症が多いという関連を示した論文を紹介しました。片方だけでは、統計的に意味のある関連は出ていません。

芯にしたのは、数字の大きさではありません。同じ論文の、同じ段落の中で、動詞が変わる、ということです。

結果を述べる文は「associated with(関連していた)」と書いています。そのすぐあとの文は「caused(引き起こした)」と書いています。あいだに挟まる文は1つだけです。データは同じ、研究デザインも同じです。変わったのは動詞だけです。

この記事では、動画で言えなかったことを足します。誰をどう分けて何をいつ測ったのか。2.07という数字がどこから来て、何を指しているのか。症状の重さで分け直すと何が見えるのか。そして、著者自身が書いている限界です。

先に断っておきます。この記事は、著者がごまかしている、という話ではありません。著者は断面の弱さを自分で書き、それを補うために2つめのデータを持ち出しています。ここで練習したいのは、書いた人を疑うことではなく、書かれた文のどこで主張の強さが変わるかに気づくことです。

誰を、どう分けて、いつ測ったか

割り付けはありません

まず、この研究にはくじ引きがありません。観察研究です。誰かに不眠や不安を割り当てた人はいませんし、治療を与えた人もいません。論文は、観察研究の報告の手引き(STROBE)に沿って書いたと明記しています。

ですから、この記事には「割り付けどおりに比べた」も「実際に受けたかで分けて比べた」も出てきません。比べているのは、もともと不眠や不安があった人と、なかった人です。この2つのグループは、はじめから同じではありません。論文自身がそう書いています。重なっていた人は、そうでない人と比べて、教育の程度が低く、喫煙が多く、心臓や血管や代謝の病気を持ちやすい傾向がありました。

2つのデータ。性質がまるで違います

この論文は、2つのデータを使っています。組み合わせ方に名前を付けていて、「dual-cohort study(2つのコホートを組み合わせた研究)」と呼んでいます。

1つめは上海のデータです。論文の中では SHAPE と呼ばれています。これは断面のデータです。論文の方法の欄に、地域を基盤とした SHAPE コホートのベースラインの測定にもとづいて、断面の比較を行った、と書かれています。要旨でも「the cross-sectional cohort(断面のコホート)」と呼んでいます。

断面とは、同じ時点で一度に測る、ということです。不眠や不安の有無と、認知機能の状態が、同じ時点の、ベースラインの調査で決まっています。どちらが先だったかを示す情報は、このデータの中にありません。

2つめは英国のデータです。UK Biobank と呼ばれています。こちらは縦断です。2006年から2010年にかけて英国の22のセンターでベースラインを測り、そのあとは全国の登録記録とつないで追いかけています。

上海のデータ:誰が入ったか

上海のデータは、2024年6月から2025年12月にかけて、上海の16の地域で集められました。解析に入ったのは65,857人です。条件は2つで、登録の時点で60歳以上であること、そして大事な変数に欠けがないことです。除外の流れ図は補足資料(Figure S1A)にあり、本文には人数の内訳が書かれていません。

参加した人の平均年齢は72.6歳(標準偏差8.1)、女性は27,105人で41.2パーセントでした。

このうち3055人が、血液のマーカーを測るサブコホートに入っています。選び方は無作為抽出だと書かれています。血液のマーカーの話は、65,857人全員の話ではありません。

上海のデータ:どう4つに分けたか

不眠と不安は、質問に答える尺度で測っています。

不眠とされたのは、8項目のアテネ不眠尺度(AIS-8)の点数が6点を超えた人、または睡眠薬を使っている人です。「または」です。点数が低くても、睡眠薬を使っていれば不眠の側に入ります。

不安とされたのは、7項目の全般性不安症尺度(GAD-7)の点数が4点を超えた人です。

この2つを組み合わせて、参加者は4つの型に分けられました。どちらもない人、不眠だけの人、不安だけの人、両方ある人の4つです。両方あった人は1592人で、全体の2.4パーセントでした。

睡眠薬の扱いには、少し注意が要ります。薬を使っている人が不眠の側に入るということは、この群には治療を受けている人が混ざる、ということです。著者は、睡眠薬を使っている人を除いた解析も行い、結果は変わらなかったと書いています。ただしこれは、薬が効いたかどうかを調べたものではありません。

上海のデータ:もっと細かい9つの分け方

論文にはもう1つ、症状の重さで分け直した解析があります。動画では触れていません。

アテネ不眠尺度は3段に分けられています。4点未満が不眠なし、4点から6点が不眠の疑い、6点を超えると臨床的に意味のある不眠です。全般性不安症尺度も3段です。0点から4点が不安なし、5点から9点が軽い不安、10点以上が中等度から重い不安です。

3段と3段を掛け合わせて、9つのグループができます。この分け方の結果は、この記事の後ろの節で図にしています。

上海のデータ:何を「認知機能の障害」としたか

上海での主な評価項目は、認知機能の障害です。

診断は、老年精神科医と一般の医師が、臨床像から行っています。あわせて TCSA という電子式の認知機能の検査の、簡易版が使われました。著者自身が以前に作って妥当性を確かめた道具だと書かれています。なお、本文の表記は 11-point screening module です。11点式とも11項目とも読める書き方で、どちらなのかは本文から決められません。

ここで2つ、本文から分からないことがあります。1つは、この検査の何点以上を障害としたのかです。検査の中身は補足資料にあり、本文には書かれていません。もう1つは、検査の正式な名前です。本文の英語の表記が崩れており、そこから確定できません。

読み取れるのは、機械的な点数のカットオフではなく、医師の診断が主で、検査はそれを助ける道具として使われている、ということです。ただし本文は、医師が臨床像から診断したことと、TCSA で認知機能を評価したことを並べて書いているだけで、どちらが主かは書いていません。この読み取りはこの記事のものです。

英国のデータ:誰が入ったか

英国のデータで、除外の条件に当てはまらず解析に入ったのは149,467人です。

除かれたのは3種類の人です。60歳未満の人、ベースラインの時点ですでに認知症があった人、そして大事な変数に欠けがある人です。除外の流れ図は補足資料(Figure S1B)にあり、本文には人数の内訳が書かれていません。

参加した人の平均年齢は63.9歳(標準偏差2.8)、女性は72,227人で48.3パーセントでした。上海の72.6歳(標準偏差8.1)と並べると、英国のほうが若く、年齢のばらつきも小さいグループです(この並べ方はこの記事のもので、論文が2つを比べて論じているわけではありません)。

この149,467人が、次に出てくる割合の分母にあたります。

英国のデータ:数え方が違います

ここが、動画で触れられなかったところです。英国のデータでは、不眠と不安を質問票では測っていません。診断名で数えています。

不安は、ICD-10 という国際的な病気の分類の F41(その他の不安障害)です。不眠は、主に ICD-10 の F51.0(非器質性不眠症)と G47.0(入眠と睡眠維持の障害)です。これに加えて、ふだん眠れないことが多い、という自己申告の項目を足して範囲を広げています。細かい定義は補足の表(Table S1)にあります。

著者は、この選び方の理由を書いています。一過性の症状ではなく、慢性で臨床的に意味のある状態を取りたかったから、です。

英国でもやはり4つの型に分けています。両方あった人は2785人で、149,467人のうちの1.9パーセントでした。

つまり、上海で「不眠」と呼ばれている人と、英国で「不眠」と呼ばれている人は、同じではありません。上海は質問票の点数に届いた人、または睡眠薬を使っている人で、英国は医療の記録に診断名が付いた人です。不安についても同じです。

著者はこの違いを、弱点ではなく強みとして書いています。スクリーニングの尺度で測った症状のレベルでも、ICD-10 の重い診断のレベルでも、同じ向きの結果が出た、という書き方です。

この書き方はもっともです。ただし読む側としては、もう1つの意味も同時に持っておくとよいと思います。2.07と1.54という2つの数字を、同じものを2回測った結果として並べることはできない、ということです。測った人も違えば、測った物差しも違い、結果として数えたものも違います。

英国のデータ:何を数えたか

英国での主な評価項目は、全原因の認知症の発生です。ICD-10 の F00 から F03 にあたる記録が使われています。登録データベースの記録であって、研究者が一人ひとりを診察したわけではありません。

追跡は、認知症が起きるか、亡くなるか、打ち切りになるかの、いちばん早いところまでです。

なお、追跡期間の中央値は本文に書かれていません。本文にあるのは、15年の追跡期間にわたる累積の発生率という記述だけです。だからこの記事でも、全員を15年追いかけた、とは書きません。

そろえた条件

どちらのデータでも、次の項目を調整しています。年齢、性別、教育の程度、喫煙、飲酒、そして高血圧、糖尿病、冠動脈の病気、脳卒中の既往です。

うつも調整されています。上海では15項目の老年期うつ病尺度が5点以上、英国では ICD-10 の F32 から F33 の診断です。不眠と不安の両方があるとうつも多いと考えられるので、ここを調整しているかどうかは大事な情報です。

APOE ε4 という、アルツハイマー型認知症になりやすさに関わる遺伝子の型は、英国のモデルと、上海の血液マーカーのサブコホートのモデルでだけ調整されています。上海の65,857人の主な解析では調整されていません。

使った計算

上海ではロジスティック回帰を使い、オッズ比を出しています。英国では Cox 比例ハザード回帰を使い、ハザード比を出しています。

重なりの効果については、足し算の目盛りでの交互作用を主に使っています。RERI と AP という2つの指標です。この2つは、この記事の後ろの節で詳しく書きます。

もう1つ、相乗指数(SI)という指標があります。著者はこれを主要な指標にしていません。理由も書かれています。相乗指数は、2つの要因がそれぞれ単独でも危険を上げているときにしか正しく解釈できないのに、この研究では片方ずつでは、統計的に意味のある関連が出ていなかったから、です。考察では、実際に相乗指数の推定は不安定で、信頼区間からは何も読み取れなかった、とも書いています。

判定は両側の p 値が0.05未満、解析は R の4.5.0 で行われています。

この数字は、何を指しているか

まず、調整する前の割合を見ます

上海のデータでは、認知機能の障害があった人の割合が、重なっていた人で67.3パーセント、重なっていなかった人で29.4パーセントでした。

これは調整する前の、そのままの割合です。年齢も教育も喫煙も、何もそろえていません。

上海のデータ:認知機能の障害があった人の割合(調整する前)

左の100個の点が、不眠と不安が重なっていた人です。色が付いた点が、認知機能の障害があった人にあたります。100人のうち67人です。

右の100個の点が、重なっていなかった人です。色が付くのは100人のうち29人です。

この2つは、同じ日に一度に測った割合です。眠れなくなったのが先か、認知機能が下がりはじめたのが先かは、この図からは分かりません。図の左右は、時間の前後ではありません。

そして、この割合は何も調整していません。年齢が高い人ほど認知機能の障害は多くなりますし、重なっていた人のほうが教育の程度は低めでした。次の節で出てくる2.07は、こうした条件をそろえたあとの数字で、この67と29から直接計算したものではありません。

不眠と不安が重なっていた人(1592人)100人中 67人
重なっていなかった人(片方だけの人を含む)100人中 29人

100人あたりの人数に直して並べています。論文の数字は67.3パーセントと29.4パーセントで、この図はそれを整数に丸めて67人と29人にしています。同じ時点で一度に測った割合であって、これから何年かのあいだになる確率ではありません。年齢や教育や喫煙などをそろえる前の、そのままの割合です。比べる相手も、次の図のオッズ比とは違います。こちらは重なっていなかった人すべてで、片方だけの人も含まれています(論文が直前の文で「重なっていない人と比べると」と書いているので、そう読めます。この読み取りはこの記事のものです)。 数字の見方を学ぶための図で、個人の予測ではありません。

論文のどこ:論文の Results の「Attributes of study population」の段落です。参加者の特徴そのものは Table 1、血液マーカーの比較は補足の表に案内されています

2.07 は、オッズ比です

調整したあとの数字が、動画で出した2.07です。

この2.07は、人数の比ではありません。オッズ比です。

オッズというのは、起きた人の数を、起きなかった人の数で割ったものです。割合そのものではありません。オッズ比は、そのオッズを2つのグループのあいだで割った値です。

比べる相手は、4つに分けたうちの、どちらもない人だと読めます(本文は重症度別の解析のところで「基準の危険からずれなかった」と書くだけで、どの群を基準にしたかを名指ししていません。4群の解析でも同じ基準だと読めますが、この読み取りはこの記事のものです)。

大事なのは、2.07を「2.07倍の人がそうなっていた」と読まないことです。オッズ比は、結果がありふれているときには、割合の比よりも1から遠い値になります。ここでは、さきほど見た割合のとおり、認知機能の障害があった人は3割から7割にのぼります。かなりありふれた結果です。こういうときにオッズ比だけを見ると、実際の人数の差より大きな印象を持ちやすくなります。

なお、調整する前の割合の比は67.3を29.4で割って約2.3にあたります(この割り算はこの記事でしたものです)。

ここで、2.07は2.3より小さいから、さきほどの「オッズ比は1から遠くなる」という説明と合わない、とは考えないでください。2.3は割合の比であって、オッズ比ではありません。同じ67.3と29.4からオッズ比を出すと約4.9になり、割合の比よりも1から離れます(この計算もこの記事でしたものです)。

そして2.07は、調整する前のこの2つとは別の計算から出た、条件をそろえたあとの数字です。比べる相手も違います。調整する前の2.3と、調整したあとの2.07は、大小を比べても意味がありません。

幅は、何を表しているか

2.07には、1.84から2.33という幅が付いています。95パーセントの信頼区間です。

この幅が表しているのは、推定がどれくらい定まっていないか、です。参加した人たちのばらつきの幅ではありません。95パーセントの確率で本当の値がこの中にある、という意味でもありません。

倍率の指標では、差がない位置は0ではなく1です。1は、2つのグループでオッズが同じ、という位置です。この記事の図でも、倍率の図には1のところに線を引いています。

幅で見る:上海の2.07

上海のデータ:不眠と不安が重なっていた人の、認知機能の障害のオッズ比

まず横の目盛りを見てください。縦に立っている線が1です。倍率の指標なので、ここが差のない位置になります。丸が推定値、横に伸びる棒がその幅です。

丸は2.07のところにあります。どちらもない人と比べたときの、認知機能の障害のオッズ比です。人数が2.07倍いた、という意味ではありません。

棒の左の端は1.84、右の端は2.33です。1をまたいでいません。ここから読めるのは、このモデルの中では、重なっていた人のほうで認知機能の障害が多い向きの関連が推定されている、というところまでです。

幅は比較的せまいほうです。65,857人という人数の多さが効いています。ただし、幅がせまいことは、推定がぶれにくいという意味であって、それが原因だという意味ではありません。人数を増やしても、どちらが先かは分かりません。

この図には行が1本しかありません。4つの型に分けたこの解析では、不眠だけの人と、不安だけの人の数値が本文に書かれていないからです。本文は、有意ではなかった、とだけ書いています。数値は論文の図の中にあります。

不眠と不安が重なっていた人2.07(1.84 〜 2.33)
差がない位置1

1が差のない位置です。倍率の指標なので、0ではなく1に線が引かれています。この値は同じ時点で一度に測ったデータから計算したもので、何年かのあいだに起きる確率の比ではありません。幅は95パーセントの信頼区間で、推定がどれくらい定まっていないかを表します。この図の部品は各行に「幅は1をまたいでいる/いない」と自動で表示しますが、これは目盛りとの位置関係を機械的に書いたものです。効果の大きさや、原因かどうかの判定として読まないでください。

論文のどこ:論文の Results の「Synergistic association of cognitive impairment in SHAPE cohort」の最初の段落です。図は Fig. 1A に案内されています

片方だけの人の数字は、4つに分けた解析では本文にありません

ここは、動画でも触れた大事な点です。

論文は、不眠だけの人と不安だけの人について、こう書いています。どちらのデータでも、単独の不安も単独の不眠も、悪い認知機能の結果と有意には関係していなかった。そして、重なっていた人だけが、認知機能の障害と関連していた唯一の組み合わせだった、と。

「有意ではなかった」は、「関係がないと分かった」とは違います。差がはっきりしなかった、という意味です。

そして、その数字がどれくらいの幅を持っていたのかは、本文からは分かりません。4つの型に分けた解析では、単独の群のオッズ比とハザード比が本文には書かれておらず、論文の図の中にあります。幅がせまくて1のすぐそばにあったのか、幅が広くて何とも言えなかったのかは、本文を読むだけでは区別がつきません。

このあとの、症状の重さで9つに分け直した解析では、事情が少し違います。そちらでは、不安だけの群の数値が本文に書かれています。次の節で見ます。

論文の図が手元にあるなら、そこを見るのが近道です。

症状の重さで分け直すと

動画では尺の都合で落とした解析です。ここが記事でいちばん足したかったところです。

論文は、9つに分け直した解析の結果を書いています。関連が見られたのは、臨床的に意味のある不眠と不安が両方ある人だけでした。症状が軽い組み合わせと、不安だけのグループでは、どれも有意な関連が出ていません。

上海のデータ:症状の重さで9つに分け直したときのオッズ比

縦の線が1です。上の2本が不安だけのグループ、次の2本が不眠の疑いと不安が重なったグループです。下の2本が、臨床的に意味のある不眠と不安が両方あるグループです。

上の4本は、どれも幅が1をまたいでいます。0.83、1.06、0.90、1.12。推定値そのものも1の近くにあります。

ここで幅の広さを見てください。不眠の疑いと中等度から重い不安の組み合わせは、0.52から2.38まであります。半分になるところから2倍を超えるところまで、この幅の中に入っています。幅がこれだけ広いのは、このグループに入る人数が少ないためと考えられます(この説明はこの記事のもので、各グループの人数は本文に書かれていません)。これは「関連がない」のではなく、「何とも言えない」という形です。

下の2本は違います。臨床的な不眠と軽い不安で1.83、幅は1.58から2.10。臨床的な不眠と中等度から重い不安で2.67、幅は2.18から3.26。どちらも1をまたいでいません。

この2本を見ると、不安が重いほうが値が大きくなっています。論文も、不安が重くなるにつれて段階的に強くなる、と書いています。ただしそれは、臨床的に意味のある不眠がある人の中での話です。

並べ方に注意してください。上の4本と下の2本は、同じ解析の中の別のグループです。上が「安全」で下が「危険」という2つの箱ではありません。上の4本は、そもそも推定が定まっていないものを含んでいます。

軽い不安だけ0.83(0.63 〜 1.08)
中等度から重い不安だけ1.06(0.69 〜 1.64)
不眠の疑いと軽い不安0.9(0.48 〜 1.67)
不眠の疑いと中等度から重い不安1.12(0.52 〜 2.38)
臨床的な不眠と軽い不安1.83(1.58 〜 2.1)
臨床的な不眠と中等度から重い不安2.67(2.18 〜 3.26)
差がない位置1

1が差のない位置です。比べる相手は、どちらもない人たちです(本文は「基準の危険からずれなかった」と書くだけで、どの群を基準にしたかを明示していません。この読み取りはこの記事のものです)。不眠の疑いはアテネ不眠尺度の4点から6点、臨床的な不眠は6点超です。軽い不安は全般性不安症尺度の5点から9点、中等度から重い不安は10点以上です。9つのグループのうち、本文に数値が書かれている6つを並べています。どれも同じ時点で一度に測ったデータから計算したもので、これから起きることの確率の比ではありません。この図の部品は各行に「幅は1をまたいでいる/いない」と自動で表示しますが、またいでいるという表示は「関連がないと分かった」という意味ではありません。

論文のどこ:論文の Results の「Synergistic association of cognitive impairment in SHAPE cohort」の2つめの段落です。図は Fig. 1C と Fig. 1D に案内されています

「軽ければ大丈夫」とは読めません

この結果は、そう読みたくなる形をしています。ですから、読めない理由を3つ書きます。

1つめ。有意ではなかった、は、関連がないと確かめた、ではありません。上に書いたとおり、軽い組み合わせの幅はとても広いものが混じっています。0.52から2.38という幅は、ほとんど何も絞り込めていません。当てはまる人数が少ないほど幅は広くなりますが、各グループの人数は本文に書かれていません(この説明はこの記事のものです)。

2つめ。ここでいう「軽い」は、尺度の点数の話です。アテネ不眠尺度の4点から6点を、論文は「不眠の疑い」と呼んでいます。本人の実感としてつらいかどうかとは別の物差しです。

3つめ。この解析も断面です。順番が分からないという弱さは、9つに分け直しても変わりません。

この解析から読めることを1文にするなら、こうなります。この論文の中で、認知機能の障害との関連がはっきり出たのは、不眠と不安の両方が、しかもある程度の重さでそろっていたグループだけだった。

論文は、この組み合わせについても足し算の目盛りでの交互作用を計算しています。臨床的な不眠と軽い不安で RERI が1.00、AP が0.55。臨床的な不眠と中等度から重い不安で RERI が1.60、AP が0.60。どちらも p は0.001未満です。掛け算の目盛りの交互作用も、2.20(1.63から2.99)と2.51(1.56から4.05)と報告されています。

英国のデータ:追いかけた結果

上海のデータは断面です。著者はそのことを書いたうえで、英国のデータで確かめています。原文は「To address the cross-sectional limitations of the discovery cohort」で始まります。発見のもとになったコホートの、断面であることの限界に対処するために、という意味です。

英国のデータ:不眠と不安が重なっていた人の、認知症のハザード比

縦の線が1です。いちばん上が、すべての認知症をまとめた結果で、1.54。幅は1.32から1.79です。

上海の2.07と並べて、数字が小さくなった、と読まないでください。測ったものが違います。上海は同じ時点での認知機能の障害、英国は追跡中に登録された認知症です。指標もオッズ比とハザード比で違います。同じ物差しの上に乗っていません。

下の2本は、認知症の種類別です。アルツハイマー型が1.48、血管性が1.89。どちらも上の行に含まれている人たちの内訳で、別々に集めた3つの集団ではありません。

血管性の幅は1.37から2.61と広めです。一般に、当てはまる人数が少ないほど幅は広くなりますが、血管性の人数は本文に書かれていません。値が大きいことと、推定が定まっていることは別だと分かります。

そして、このデータでも、不眠だけの人と不安だけの人では関連が出ていません。本文は「but individual anxiety and insomnia symptoms were not」とだけ書き、数値は図に置いています。

すべての認知症1.54(1.32 〜 1.79)
アルツハイマー型1.48(1.15 〜 1.91)
血管性1.89(1.37 〜 2.61)
差がない位置1

1が差のない位置です。上海の図とは別のデータ、別の測り方、別の結果です。ここで数えているのは、追跡のあいだに新しく認知症と記録された人で、上海で数えた認知機能の障害とは違います。不眠と不安の決め方も、上海は質問票、英国は診断名です。ハザード比は、追いかけているあいだの起こりやすさの比で、何人増えるかではありません。アルツハイマー型と血管性は、全体の認知症の内訳にあたります。幅は95パーセントの信頼区間です。この図の部品は各行に「幅は1をまたいでいる/いない」と自動で表示しますが、これは目盛りとの位置関係を機械的に書いたものです。

論文のどこ:論文の Results の「Longitudinal confirmation of incident dementia in UKB cohort」の段落です。全体の認知症は Fig. 2A、認知症の種類別はアルツハイマー型が Fig. 3A・3B、血管性が Fig. 3C・3D に案内されています。本文は2枚ずつ案内するだけで、どの値がどちらのパネルにあるかは書き分けていません

英国のデータで、ほかに書かれている数字

足し算の目盛りでの交互作用は、RERI が0.50(0.11から0.90、p は0.006)、AP が0.33です。掛け算の目盛りでは、ハザード比1.49(1.07から2.09、p は0.02)です。

認知症の種類別にも、それぞれ交互作用が計算されています。アルツハイマー型では RERI が0.64、AP が0.43、p は0.046。掛け算の交互作用はハザード比1.77、p は0.048です。血管性では RERI が0.93、AP が0.49、p は0.036。ただし、掛け算の目盛りの交互作用はハザード比2.02で、p は0.111と、有意になっていません。

同じ組み合わせでも、足し算の目盛りでは有意になり、掛け算の目盛りでは有意にならないことがあります。どちらの目盛りで見るかで、有意かどうかの結論が変わりうる、ということです。

15年の追跡期間にわたる累積の発生率は、重なっていた群のほうが、片方だけの群やどちらもない群より高かったと書かれています。数値そのものは論文の図にあり、本文にはありません。

5年を除いても変わらなかった、という確かめ

ここは動画でも触れました。

もし、認知機能がすでに下がりはじめていた人が、その結果として眠れなくなり不安になっていたのだとしたら、ベースラインの直後に認知症と診断される人が多く出るはずです。著者は、ベースラインでうつがあった人と、追跡の最初の5年のあいだに認知症になった人を、英国のデータから除いた解析をしています。除いても、関連は統計的に有意なままだった、と書かれています。なお、2つを別々に除いた2本の解析なのか、まとめて除いた1本なのかは、本文からは決められません。

これは、逆向きの説明をいくらか弱める確かめです。ただし、逆向きの説明を消すものではありませんし、原因だと決めるものでもありません。5年より前から始まっていた変化は、この除外では取り除けません。

上海のデータについても感度分析が行われています。脳卒中の既往がある人、教育の程度が低い人、睡眠薬を使っていると自己申告した人を、順に除いた解析です。結果は変わらなかったと書かれています。ただし、上海のデータには追跡がないので、順番を調べる感度分析は行われていません。

0.57 は、何の割合か

ここが、この記事の軸です。

同じ段落の中で起きていること

論文の結果の節に、こういう並びがあります。

1つめの文。断面の SHAPE の研究では、不眠と不安が重なっていることが、認知機能の障害と関連していた唯一の組み合わせだった。オッズ比は2.07。ここで使われている動詞は associated with、つまり「関連していた」です。

2つめの文。足し算の目盛りの交互作用と、掛け算の目盛りの交互作用が、どちらも有意だった。

3つめの文。AP は0.57で、これはこの交互作用が、不安と不眠が重なっている人において、認知機能の障害の危険の57パーセントを caused した、ということを示している。ここで使われている動詞は caused、つまり「引き起こした」です。

1つめと3つめのあいだに挟まっているのは、2つめの1文だけです。同じ段落、同じデータ、同じ断面のデザインです。変わったのは動詞です。

AP とは何か

AP は attributable proportion の略で、寄与割合と訳されます。RERI とともに、足し算の目盛りでの交互作用を測る指標です。

読み方に2つの条件が付きます。

1つめ。主語は交互作用です。不眠でも不安でもなく、2つが重なったことによる上乗せの分です。不眠と不安の影響を全部合わせて57パーセント、ではありません。

2つめ。範囲は「重なっている人の中で」です。原文も in individuals with comorbid anxiety and insomnia と書いています。集団全体の57パーセントではありませんし、日本の高齢者の57パーセントでもありません。

0.57 は、上の2つの数字から計算し直せます

AP は、RERI を、両方ある群のオッズ比で割った値にあたります。この論文の数字で実際に計算してみます。RERI が1.17、両方ある群のオッズ比が2.07なので、1.17割る2.07は約0.565です。四捨五入すると0.57になります(この割り算はこの記事でしたものです)。

英国のデータでも同じです。RERI が0.50、ハザード比が1.54なので、0.50割る1.54は約0.325。報告されている AP は0.33です。重症度別の解析でも合います。1.00割る1.83は約0.55、1.60割る2.67は約0.60。どちらも報告と一致します。

ここから分かるのは、0.57という数字が、新しい観察から出てきたものではない、ということです。すでに出ている2つの推定値を組み合わせて言い直したものです。

だから、こういう見方ができます。2.07を出したデータで言えることと、0.57を出したデータで言えることは、同じです。0.57のほうが強い言い方で書かれていても、支えているデータの性質は変わっていません。

AP には、本文に幅が書かれていません

もう1つ、目に留めておきたいことがあります。

2.07には1.84から2.33という幅が付いています。RERI の1.17にも0.87から1.47という幅が付いています。ところが、AP の0.57には、本文に幅が書かれていません。英国の0.33にも書かれていません。

ただし、論文は上海の AP(0.57)を書いたすぐあとで、相乗指数を含む交互作用の指標はすべて補足の表(Table S3)にある、と案内しています。ですから、論文全体として幅がない、とは言えません。その表はこの記事を書いた時点で手元にないので、そこに幅が載っているかどうかは確かめていません。

本文の中で、幅の付いた数字と、幅の付かない言い換えが並んでいるときは、幅の付いたほうを手がかりに読むほうが安全です。

上海のデータ:足し算を上回った上乗せの分(RERI)

この図の縦の線は0です。RERI は引き算で作る指標なので、差のない位置が1ではなく0になります。

推定値は1.17、幅は0.87から1.47です。0をまたいでいません。この論文の中では、重なりによる上乗せが、片方ずつの上乗せを足したものより大きい向きで推定されています。

AP の0.57は、この1.17を、両方ある群のオッズ比2.07で割った値にあたります。つまり、この図の数字と、前の図の数字を組み合わせた言い直しです。新しく測ったものではありません。

そして、この図の数字も、同じ時点で一度に測ったデータから出ています。幅が0をまたいでいないことは、順番が分かったことを意味しません。

重なりによる上乗せの分(RERI)1.17(0.87 〜 1.47)
差がない位置0

RERI は引き算の指標なので、差のない位置は0です。0を超えていれば、両方ある群の上乗せが、片方ずつの上乗せを足したものより大きい、という向きになります。この0.57という AP は、この RERI を、両方ある群のオッズ比2.07で割った値にあたります(この割り算はこの記事でしたものです)。AP そのものには信頼区間が本文に書かれていないため、この図には RERI を置いています。これも同じ時点で一度に測ったデータから計算したものです。

論文のどこ:論文の Results の「Synergistic association of cognitive impairment in SHAPE cohort」の最初の段落です。図は Fig. 1B に案内されています

論文の中では、名詞も揺れています

もう1つ、気づいたことを書いておきます。

上海のデータは断面です。それなのに、結果の節では incident cognitive impairment、つまり「新しく起きた認知機能の障害」という言い方が使われています。一方で、要旨の考察のところでは higher prevalence of cognitive impairment、つまり「認知機能の障害を持つ人の割合が高い」と書かれています。

同じことを指しているはずの箇所で、言い方が2通りあります。断面のデータからは、新しく起きた数は数えられません。ですから、この記事では一貫して「認知機能の障害がある人が多かった」という言い方にしています。

動詞だけでなく、名詞も同じように見ておくと、デザインと言い方のずれに気づきやすくなります。

1.87 パーセントは、何の割合か

英国のデータで、もう1つ数字が出ています。人口寄与割合(PAF)です。

論文は2つの数字を並べています。まず、追跡中に認知症になった人のうち、この組み合わせを持っていた人の割合が5.33パーセントでした。そして、完全に調整した Cox モデルにもとづいて推定した PAF が1.87パーセント(1.31から2.36パーセント)でした。

この数字の意味

PAF は、その集団からその要因がなくなったとしたら、という問いに答える形の指標です。ですから、この1.87という数字を使うには、関連が原因であるという前提が要ります。前提が満たされているかどうかは、このデータでは確かめられません。ですからこの記事では、この1.87を、仮に原因だったとしたらこれくらい、という条件付きの数字として扱います。

この数字も、計算し直せます

PAF は、認知症になった人のうちその状態だった人の割合と、ハザード比から組み立てられます。実際に計算してみます。0.0533に、1.54から1を引いた0.54を1.54で割った値を掛けると、約0.0187、つまり1.87パーセントになります(この計算はこの記事でしたものです)。報告されている値と一致します。

ここでも、新しい観察が加わっているわけではありません。すでに出ている数字の言い直しです。

1.5倍と、2パーセント弱

英国のデータの中に、1.5倍ほどという関連の大きさと、集団全体で説明できる分が2パーセント弱という数字が並んでいます。

どちらも正しく、矛盾していません。英国のコホートで重なっていた人は1.9パーセントでした。関連の大きさが1.54でも、その状態にある人が少なければ、集団全体で説明できる分は小さくなります。この説明はこの記事のものです。

見出しになるのは、たいてい前者です。読むときには、後者も一緒に探すと、その要因が集団の中でどれくらいの位置を占めているのかが分かります。

血液のマーカーの話

動画では触れなかった部分です。論文の3つめの目的にあたります。

対象は、上海のサブコホート3055人です。65,857人全員ではありません。

測ったのは3つです。p-tau217、GFAP、NfL という血液中の物質です。論文は考察で、p-tau217 を脳のアミロイドの病理と、GFAP をアストロサイトという細胞の反応と結びつけて論じています。NfL が何を映すものかについての説明は、本文に見当たりません。機器の名前と方式は本文に書かれています。

重なっていた群との関連は、p-tau217 が b = 0.42(0.31から0.52、p は0.001未満)、GFAP が b = 0.24(0.10から0.39、p は0.001)でした。NfL は b = −0.14(−0.43から0.16、p は0.356)で、関連が出ていません。片方だけの群は、どのマーカーとも有意な関連がありませんでした。

媒介の解析では、対数オッズの目盛りで、p-tau217 が0.32(0.233から0.425)、GFAP が0.03(0.006から0.078)、NfL が−0.004(−0.024から0.003)でした。3つ合わせた間接の効果は0.35(0.254から0.456)、全体の効果は1.10(0.772から1.398)です。間接の効果が全体の何パーセントにあたるかは、本文に書かれていません。

媒介の解析にも、順番の前提が入っています

媒介の解析は、要因があって、それがマーカーを動かし、マーカーが結果を動かす、という順番をあらかじめ置いたうえで計算します。

上海のデータは断面です。マーカーも1時点でしか測っていません。この点は、著者自身が限界の1つめに挙げています。p-tau217 と GFAP が時間とともにどう動くかについて、確定的な結論は出せない、と書かれています。

ですから、この節の数字も、「重なっていることがマーカーを上げ、マーカーが認知機能を下げた」と読むには足りません。読めるのは、重なっていた群でこれらのマーカーが高く、統計のモデルの中ではその分が関連の一部を説明する形になった、というところまでです。

この研究では言えないこと

順番が分かりません

主な解析は断面です。不眠や不安と、認知機能の状態を、同じ時点で測っています。

ですから、認知機能が下がりはじめたことで眠れなくなった、あるいは不安が強くなった、という向きでも、上海の数字は同じように説明できます。上海のデータについて、その向きを調べた記述は本文にありません。

英国のデータは縦断なので、少なくとも曝露を測った時点と、認知症が記録された時点の前後関係があります。最初の5年のあいだに認知症になった人を除いた感度分析も、逆向きの説明を弱める向きに働きます。ただし、論文はこの感度分析の狙いを書いていません。狙いについての読みは、この記事のものです。

それでも、英国のデータも観察研究です。くじ引きはありません。

著者が限界として挙げている4点

論文の最後の段落に、著者自身が限界を書いています。この記事では4点に分けて紹介します。論文では First、Second、Third と3つが並び、4点目はそのあとに Furthermore(さらに)と続けて書かれています。4点という数え方は、この記事のものです。

1つめ。上海の血液マーカーは1時点でしか測られていません。時間とともにどう動くかは分かりません。

2つめ。参加者が使っていた向精神薬の細かい分類、とくに睡眠に関わる鎮静薬(睡眠薬と抗不安薬)の種類が分かりません。客観的な睡眠の測定もありません。そのため、薬の使用による交絡を完全には除けない、と書かれています。

ここは大事なところです。上海では、睡眠薬を使っていること自体が不眠の判定に入っています。ただし論文は、この2つを結びつけて書いてはいません。結びつけたのはこの記事の読みです。

3つめ。機序を調べるための追加の解析は、対象の人数が限られていて検出力が足りませんでした。方向としての傾きは見えたものの、多重比較の補正をしたあとでは統計的に有意になりませんでした。

4つめ。血管性認知症に特有の機序を調べるための指標が、コホート全体にありません。

なお、断面であることは、この限界の段落には入っていません。結果の途中で触れられています。

英国のデータの、参加者の偏り

著者は考察の中で、もう1つ書いています。

英国のコホートで、この組み合わせを持っていた人の割合は1.9パーセントと小さいものでした。著者は、これがおそらく実際の社会の重さを映していないだろう、と書いています。理由は、このコホートに参加したのが、進んで参加を申し出た人たちで、一般の人よりも健康なほうに寄っているからです。

向きに注意してください。著者が言っているのは、割合が小さめに出ている、ということです。だからこの結果は当てにならない、という話ではありません。むしろ、実際の社会ではこの組み合わせを持つ人がもっと多いかもしれない、という向きです。

この記事の読みを1つ足すと、PAF の1.87パーセントも、集団の中にどれくらいその状態の人がいるかに左右される数字です。割合が小さめに出ているなら、それにもとづく数字も小さめに出ている可能性があります。ここは論文が書いていることではなく、この記事の読みです。

2つのデータが測ったものは、同じではありません

上海と英国で、不眠と不安の決め方が違います。質問票の点数と、ICD-10 の診断名です。結果も違います。認知機能の障害と、登録記録の認知症です。測った時期も、2024年から2025年と、2006年から2010年です。

著者はこの違いを強みとして書いています。違う測り方でも同じ向きの結果が出たから、という論じ方です。

同時に、読み手の側では、2つの数字を足したり、平均したり、片方を片方の検算に使ったりはできません。ここは論文が書いていることではなく、この記事の読みです。

片方だけの人については、言えることが限られます

4つの型に分けた解析では、不眠だけの人と不安だけの人の数値が本文にありません。有意ではなかった、という記述だけです。数値は論文の図の中にあります。

症状の重さで9つに分け直した解析のほうには、不安だけの群の数値が本文に書かれています。軽い不安だけが0.83(0.63から1.08)、中等度から重い不安だけが1.06(0.69から1.64)です。どちらも幅が1をまたいでいます。一方、不眠だけの段の数値は、この解析でも本文にありません。

これを「不眠だけなら安全」と読むことはできません。不眠だけの群については、4つに分けた解析でも、9つに分け直した解析でも、幅がどれくらいあったのかが本文からは分からないからです。そして、幅が1をまたいでいることは、関連がないと確かめた、という意味ではありません。

治療については、何も試していません

この研究は、治療や商品の効果を確かめたものではありません。

睡眠薬は、上海で不眠を判定するための条件の1つとして出てくるだけです。睡眠薬を使っている人を除いた感度分析もありますが、これは薬の効果を調べたものではありません。

著者は考察で、不眠と不安は行動療法や薬で治療できるものだ、という一般論を書き、睡眠と感情のコントロールを狙った認知行動療法のような組み合わせた治療が、認知症の発症を防ぐかもしれない、と提案しています。これは提案であって、この研究で試されたことではありません。

サプリメント、寝具、睡眠時間の目安についての記述は、本文にありません。この記事でも扱いません。眠れないことや不安が続くときは、この記事の数字ではなく、医師に相談してください。

どこまでの人に当てはまるか

上海のデータは、上海の16の地域に住む60歳以上の人たちです。英国のデータは、英国で進んで参加した60歳以上の人たちです。

どちらも高齢者のデータです。若い人に同じことが当てはまるかどうかは、この研究からは分かりません。

元の論文の、どこを見ればよいか

手がかりを置いておきます。節の名前は論文のままです。

  • 断面であること:Methods の「Study design and populations」の2つめの段落です。要旨の Methods にも同じことが書かれています。
  • 上海の人数、時期、地域、サブコホートの3055人:同じ段落です。除外の流れ図は補足資料に案内されています。
  • 英国の人数と、除外した人:同じ節の3つめの段落です。こちらも流れ図は補足資料です。
  • 不眠と不安の決め方(上海):Methods の「Assessments in SHAPE cohort」の最初の段落です。9つに分け直した基準も、この段落の後半にあります。
  • 何を認知機能の障害としたか:同じ節の2つめの段落です。検査の中身は補足の方法に案内されています。
  • 不眠と不安の決め方(英国)と、認知症の数え方:Methods の「Assessments in UKB cohort」です。細かい定義は補足の表に案内されています。
  • 調整した項目:Methods の「Covariates」です。
  • 統計の方法、RERI と AP、相乗指数を主要な指標にしなかった理由:Methods の「Statistical analysis」の最初の2つの段落です。感度分析の中身は、同じ節の3つめの段落にあります。
  • 67.3パーセントと29.4パーセント、重なっていた人の人数と割合:Results の「Attributes of study population」の段落です。参加者の特徴の表は Table 1 に案内されています。
  • オッズ比2.07、RERI 1.17、AP 0.57、そして associated with と caused:Results の「Synergistic association of cognitive impairment in SHAPE cohort」の最初の段落です。3つの文が続けて置かれています。図は Fig. 1A と Fig. 1B。交互作用の指標がすべて補足の表(Table S3)にあるという案内も、AP のすぐあとにあります。
  • 症状の重さで分け直した6つの数字:同じ節の2つめの段落です。図は Fig. 1C と Fig. 1D。
  • ハザード比1.54、認知症の種類別の1.48と1.89、血管性で掛け算の交互作用が有意でないこと:Results の「Longitudinal confirmation of incident dementia in UKB cohort」の段落です。図は Fig. 2A と Fig. 2C、アルツハイマー型が Fig. 3A・3B、血管性が Fig. 3C・3D。本文は2枚ずつ案内するだけで、どの値がどちらのパネルにあるかは書き分けていません。
  • 血液マーカーと媒介の数字:Results の「Biomarker associations and mediation analysis」の2つの段落です。図は Fig. 4A と Fig. 4B、細かい値は補足の表に案内されています。
  • 5.33パーセントと PAF の1.87パーセント:Results の「Population attributable fraction」の節です。2文しかありません。
  • 感度分析:Results の「Sensitivity analyses」の節です。結果の表は補足に案内されています。
  • 単独では危険を上げないという先行研究との関係:Discussion の2つめの段落です。メンデルランダム化を使った研究への言及もここにあります。
  • 英国の参加者が一般の人より健康なほうに寄っていること:Discussion の中ほど、臨床への含意を述べた段落の次の段落です。
  • 相乗指数の推定が不安定だったこと:Discussion の、交互作用の指標の選び方を論じた段落です。
  • 2つのコホートの定義の違いを強みとしていること:Discussion の「This study has several strengths」で始まる段落です。
  • 著者自身の限界4つ:Discussion のいちばん最後の段落です。
  • 資金と利益相反:資金は中国の国家プロジェクトと国家自然科学基金、英国のデータの利用は申請番号で示されています。著者は商業的・金銭的な利益相反はないと申告しています。個々の著者の開示は補足資料にあります。

補足資料(Supplementary Methods、Figure S1・S2、Table S1からS9)と、図の中の数字は、この記事を書いた時点で手元にありません。ですから、本文が「図を参照」「補足の表を参照」とだけ書いている数字は、この記事では扱っていません。

元の論文はこちらです。Chen Y ら. Synergistic association of insomnia and anxiety with cognitive impairment and dementia in older adults. Alzheimers Dement. 2026. https://doi.org/10.1002/alz.71853

見方を練習するために

この記事は本の紹介を含みます。下で紹介する本には、アフィリエイトのリンクを付けています。ページの上と下に出ている PR の表示は、そのことを示しています。リンクから買っても値段は変わりません。

この回の柱を、持ち帰れる形にします。論文や、それを紹介した記事を読むときに、順に当てる3つの問いです。

1つめ。動詞を見る。関連していた、と書いてあるのか、引き起こした、防ぐ、進める、と書いてあるのか。この論文では、その2つが同じ段落の中に並んでいます。あいだに挟まる文は1つだけです。データが増えたわけでも、デザインが変わったわけでもありません。

2つめ。その数字が、新しい観察なのか、すでにある数字の言い直しなのかを確かめる。この論文の0.57は、1.17を2.07で割った値にあたります。1.87パーセントも、5.33パーセントと1.54から組み立てられます。言い直しは悪いことではありません。ただし、言い直しによって主張が強くなることはありません。

3つめ。いつ測ったかを見る。同じ時点で一度に測ったのか、先に測って後から数えたのか。この一点で、言えることの範囲が変わります。この論文は、両方を1本の中に持っています。だから読み比べられます。

下の本は、ある出来事が別の出来事の原因だと言うために何が要るのかを、身近な例から順に説明したものです。相関と因果の違いを、式ではなく考え方の側から扱っています。この記事の3つの問いは、その考え方を、1本の論文の文の並びに当てはめたものです。

最後にもう一度だけ書いておきます。この本は、この論文を疑うために挙げているのではありません。この論文は、断面であることも、単独では関連が出なかったことも、軽い症状の組み合わせでは関連が出なかったことも、参加者の偏りも、本文に書いています。気をつけたいのは、こうした結果が論文の外に出て、倍率の数字だけが切り取られたときです。

元の論文

Chen Y ら. Alzheimers Dement. 2026.
https://doi.org/10.1002/alz.71853

もっと知りたい人へ

PRこの記事には広告(アフィリエイトのリンク)を含みます。

『「原因と結果」の経済学』