動画で話したこと

動画では、腕時計型の機器と自動の通知を使った6か月の取り組みを、測定だけを受けるグループと比べたランダム化比較試験を紹介しました。日本の研究で、千葉県柏市で行われています。

紹介した数字は、30点満点の認知機能の検査で0.58点の差です。幅は0.03から1.13までで、0を含んでいません。

そのうえで動画がいちばん長く扱ったのは、この試験が事前に決めた大事な評価項目を3つ持っていたという点でした。認知機能の点数、段取りをつける力の検査、筋肉の量の3つです。そして、どれを優先するかの順番も、3つをまとめて評価する方法も、事前には決められていませんでした。

3つまとめて評価し直すと、同じ0.58点のp値は0.039から0.12になります。残りの2つでは、差は確かめられませんでした。著者自身が、多重性の調整に耐えず、臨床的な意味も定かでない小さな差だと書いています。

短い動画で話せたのは、ここまででした。

この記事では、そこから先に進みます。誰が、どうやって集められたのか。片方のグループは実際に何を受け取ったのか。0.58点という数字は、そもそも何の差なのか。段取りをつける力の検査には2つの部分があって、動画ではその1つしか出していません。その検査には測り方の手違いもありました。そして「0.58点は大きいのか小さいのか」を考えるための物差しは、論文の中に2つ出てきます。

先に書いておきます。この記事は、腕時計型の機器も、たんぱく質を調整した食品も、サプリメントも勧めていません。また、この研究が測ったのは6か月後の検査の点数で、認知症になったかどうかではありません。認知症を防げるか防げないかについて、この記事は何も言いません。

誰を、どう分けて、いつ測ったか

どうやって人を集めたか

募集の入口は、地域の健康づくりの施設の会員名簿でした。その施設に登録していた65歳以上の会員2210人全員に、案内が郵送されています。会員の多くは、同じ地域で行われている別のコホート研究にも入っていると書かれています。

返事をした人が電話で予約を取り、説明と選別のための受診に来ます。参加できたのは、自立して生活していて、機器を1日20時間以上着けられる意思と能力があり、スマートフォンを使える人のうち、体の弱りの目安が1つ以上ある人でした。目安は3つのうちのどれかです。年齢に対して低い体格指数(BMI)。質問票で測った虚弱の手前の状態か、虚弱そのもの。握力の低下、歩く速さが毎秒1メートル未満、骨格筋量の指標の低さのいずれかで示される、筋肉の衰えに関わる低下。

外されたのは、施設で常時の介護を受けている人、管理されていない高血圧・糖尿病・慢性腎臓病がある人、そしてすでに自分の健康管理にウェアラブルの機器を使っている人と、過去に使ったことがある人です。最後の条件は、あとの「この研究では言えないこと」でもう一度出てきます。

ランダム化が行われたのは、2023年11月8日から2024年7月31日までの期間です。

2210人の名簿から、210人までの絞られ方

いちばん外側が2210人です。これは参加した人数ではありません。案内が郵送された会員の数です。この名簿が、この研究の標本を取る枠になっています。街で無作為に選ばれた高齢者の集まりではなく、地域の健康づくりの施設に自分で登録していた人たちが入口になっている、ということです。

次が477人です。案内に返事をした人の数で、2210人の2割ほどにあたります(この割り算はこの記事のもので、論文が書いているものではありません)。このうち48人が、選別の受診の前に辞退しました。

次が429人です。参加できるかどうかを実際に調べた人数です。このうち74人が組み入れの条件を満たしませんでした。論文は、それ以外の理由で外された人はいないと書いています。

次が355人です。くじ引きで2つに分けられた人数で、通知を受け取るグループが178人、測定だけを受けるグループが177人です。動画で紹介した0.58点は、この355人全員を割り付けどおりに比べた数字です。

次が278人です。6か月後に認知機能の点数が実際に得られた人数です。差し引き77人ぶんの6か月後の点数は得られておらず、その分は統計の手続きで埋められています。埋め方については、あとの節で書きます。

いちばん内側が210人です。自分のグループに決められたデータ収集の手順を、最後まで守った人数です。ここで注意したいのは、この210人は「通知の目標を達成した人」ではないということです。機器を着け、食事をアプリに記録することに同意して続けた人、という意味の人数です。

案内が郵送された、施設の65歳以上の会員2210人
案内に返事をした人477人
参加できるかどうかを調べた人429人
くじ引きで2つのグループに分けた人355人
6か月後の認知機能の点数が得られた人278人
決められたデータ収集の手順を最後まで守った人210人

人数だけを表した図です。差の大きさを表すものではありません。5段目の278人は、6か月後の認知機能の点数が得られた人数(この評価項目の解析集団)で、6段目の210人は、自分のグループに決められたデータ収集の手順を最後まで守った人数です。主要な解析はこの2つではなく、ランダム化された355人全員で行われています。

論文のどこ:論文の Methods の Study design and participants の節、Results の最初の段落、Methods の Statistics の節(解析集団の定義)。絞り込みの流れ図は Fig. 1 にあります

くじ引きの仕組みと、隠されていなかったこと

割り付けの順番は、主任研究者が乱数表から事前に作っています。4人ずつのブロックの中で順番を入れ替える方式で、割合は1対1、年齢や点数などで層を分ける操作はしていません。

ここは丁寧に書く必要があります。順番を隠す仕組みは、別の手続きとしては用意されていませんでした。参加者を登録した研究者が、自分で順番を当てていき、その順番を見ることができ、ブロックの大きさも知っていました。封筒を使う方式も、中央でまとめて割り付ける方式も使われていません。

ただし、順番を当てたのは、適格かどうかの判断と同意、選別の検査が全員ぶん終わったあとでした。選別した順に、一度で当てています。論文は、これによって、ふつうなら生じる「割り付けを見てから、その人を外す」という機会はなくなったと書いています。そのうえで、選択の偏りを完全に除くものではないとも書いています。

選別の検査は、そのままベースライン(開始時点)の評価も兼ねていました。つまりベースラインの値は、割り付けより前に集められています。例外が1つだけあります。段取りをつける力の検査(TMT)のベースラインは、割り付けの後にやり直されました。理由はあとの節で書きます。

誰にも隠せなかったこと

割り付けの後、盲検化は達成されていません。

参加者は、自分がどちらのグループかを当然知っています。論文は理由を書いていませんが、通知が届くグループと届かないグループなので、参加者には分かります。

そして、6か月後の評価を行った職員は、機器の設定もし、期間中に参加者に連絡もし、研究の運営もしていました。論文は、そのため職員は参加者を見分けられることが多く、どちらのグループかを推測できたと書いています。この規模の単一施設の試験では、役割を分けることができなかったとも書いています。

点数をつける検査では、ここが問題になります。論文は限界の節で、測定・期待・採点の効果を除外できないと書いています。起きたと書いているのではなく、除外できないと書いています。

片方のグループが受け取ったもの

通知を受け取るグループの178人は、腕時計型の機器を受け取り、睡眠中も含めて6か月間続けて着けるよう依頼されました。

通知は、本人自身の平均のデータから、月ごと・週ごとに作られ、文章のメッセージとして届きます。目標は段階的に上がっていきます。

  • 1日の歩数:3000歩、6000歩、8000歩と上がり、8000歩以上を維持
  • 運動の時間:週45分、90分、150分と上がり、150分以上を維持(150分は世界保健機関の中強度の活動の推奨に沿う値だと書かれています)
  • 睡眠:1晩5時間、6時間と上がり、6〜9時間を維持する帯があり、9時間以上では注意が出る
  • たんぱく質(希望した人だけ):エネルギーの13%、15%と上がり、15〜20%を維持する帯があり、20%以上では注意が出る

週の通知では、寝る時刻と起きる時刻のばらつき(30分を境にする)にも触れ、前の週から歩数や運動時間が10%以上増えたときにはそれを認める内容も出ました。

ここが大事なところです。通知は、閾値による目標設定だけでした。教材も、カウンセリングも、やる気を出させる内容も届いていません。行動を変えるための理論を枠組みとして使うこともしていないと書かれています。

通知は6か月ではなく、5か月ぶん

もう1つ、動画で触れられなかった点です。

機器を着けた最初の28日間は、通知を出さないベースラインの測定期間でした。通知が始まったのは着用の1か月後で、残りの5か月のあいだ届きました。

着用そのものは6か月ですが、通知が届いていたのは5か月ぶんです。

通知の記録も残っています。146人に、週の活動の通知が平均16.9回、週の睡眠の通知が平均16.9回、月の活動の通知が平均4.9回、月の睡眠の通知が平均4.9回、送られました。栄養の通知は118人に、平均3.5回送られています。

ただし、論文は届いたことまでしか記録していないと書いています。通知が読まれたのか、行動に移されたのかは記録されていません。どちらのグループでも、機器やアプリの使い方そのものは測られていないので、自分で自分を観察していた度合いも分かりません。曝露として書けるのは「通知が届いたこと」と「機器を着けていたこと」だけだと、論文は述べています。

手順を守った介入群では、機器を着けていた日数の中央値が180日のうち121.8日(四分位範囲87.3〜145.5日)でした。これは通知のない最初の28日も含めた全期間での数です。

たんぱく質の部分と、食品の扱い

食事の部分は任意でした。使われたのは食事を記録するアプリで、内容はたんぱく質の摂取だけに限られています。広い食事の助言ではありません。

論文は、たんぱく質を選んだ理由も書いています。摂取を増やすと認知機能が良くなるからではなく、参加の条件になった筋肉に関わる弱りに最も直接つながる食事の要素で、しかも1つの量として自動で追えるからだ、としています。

希望した人は、たんぱく質を調整した食品を無償で受け取れました。たんぱく質の摂取を増やすことが費用の負担になりうるからだと書かれています。食品はたんぱく質の通知の中に示された選択肢の1つで、食事の部分に参加した人だけが受け取れます。研究の施設で受け取る形で、受け取った量は記録されていません。

この食品について、論文は自分でこう書いています。既存の商品ではなく、この試験のために共同研究先の製造元が開発したものである。「たんぱく質を調整した食品」という呼び方は製造元の商品名であって、定義された分類ではない。そして、高齢者の健康に対する効果の根拠は存在しない。たんぱく質の摂取を増やすための実用的な手段として提供されたもので、認知機能に働くと期待された要素ではない、とも書かれています。

この記事も、この食品を勧めるものではありません。

もう片方のグループ

測定だけを受けるグループの177人は、通知も助言も教育も、介入のほかの要素も、期間を通じて受け取っていません。機器を着け、食事をアプリに記録したのは、ベースラインと最終の評価の期間だけです。

論文は、この群を「通常の診療」ではなく「測定だけの対照」と呼んでいます。理由も書かれています。試験の登録には「通常の診療と健康関連の情報を受ける偽の比較」と記されているのに、偽の処置は使われておらず、この群に診療も健康関連の情報も提供されていないからです。

登録の記述と、実際に行われたことが違う。論文は、それを自分で書いています。

割り付けどおりの比較か、実際に受けたかの比較か

この試験には、解析に使う集団が3つ出てきます。見出しになる0.58点がどれから出たのかを押さえると、数字の読み方が変わります。

  • ITT(割り付けどおり):ランダム化された全員。178人と177人です。主要な推論はここで行われています
  • FAS(その評価項目の6か月後の値がある人):機器やアプリの記録が完全かどうかは問いません。認知機能の点数では140人と138人、合わせて278人です
  • PP(手順を守った人):自分のグループに割り当てられたデータ収集の手順を完了した人。114人と96人、合わせて210人です

PP の中身は確認しておく価値があります。通知を受け取るグループでは6か月を通じて機器を使ったこと、測定だけのグループでは2つの評価期間に機器を使ったこと、そして両方で食事をアプリに記録することに同意していたこと。これが条件です。歩数や運動の目標を達成したかどうかは、PP の条件に入っていません。

動画で紹介した0.58点は、ITT の数字です。つまり、割り付けどおりに全員を比べた結果です。実際に受けたかどうかで分けた比較も論文には載っていて、そちらは数字が違います。あとの節で並べます。

比べる前の2つのグループ

論文の本文は、ベースラインの特徴は釣り合っていた、と書いています(Table 1)。並んでいる数字を見ると、確かに多くの項目は近いです。

  • 年齢:75.0歳(標準偏差5.3)と75.4歳(標準偏差5.2)
  • 女性:116人(65.2%)と117人(66.1%)
  • 教育年数:14.0年と14.1年
  • 体格指数(BMI):21.5と21.7
  • 認知機能の点数:25.1点(標準偏差2.7)と25.0点(標準偏差3.2)
  • 筋肉の量の指標:どちらも6.6 kg/m²
  • 軽度認知障害の疑い(26点未満):90人(50.6%)と93人(52.5%)

ただし、同じ表の中に、開きのある項目もあります。ApoE2 という型の遺伝子を持つ人は、通知を受け取るグループで11人(6.2%)、測定だけのグループで20人(11.3%)です。割合でいうと倍近い違いです(この割り算はこの記事のもので、論文が書いているものではありません)。ApoE4 を持つ人は32人(18.0%)と29人(16.4%)で、こちらは近い値です。

ApoE2 と ApoE4 の保有は、どちらも計算の中で調整される共変量に入っています。計算で差し引かれているということです。ただし、調整できるのは測れている違いの分だけです。

参加者の認知機能の点数の広がりも書かれています。ベースラインの点数は13点から30点までで、中央値は25点でした。183人(51.5%)が、軽度認知障害の疑いの線である26点を下回っていました。30点満点を取った人は11人(3.1%)で、論文は「尺度は天井に近くはなかった」と書いています。満点が多すぎて差が出なくなる状態ではなかった、という意味です。

この数字は、何を指しているか

0.58点は、素点の平均の差ではありません

いちばん誤解されやすいところだと思います。

0.58点は、6か月後の点数の平均を2つのグループで引き算した数字ではありません。論文の言い方は「調整後の群間差」です。

計算は共分散分析(ANCOVA)という方法で行われています。6か月後の点数を、グループの違いで説明する形のモデルを作り、そこに次のものを一緒に入れて差し引いています。

  • ベースライン(開始時点)のその評価項目の値
  • 年齢
  • 性別
  • 体格指数(BMI)
  • 教育年数
  • ApoE2 を持っているか
  • ApoE4 を持っているか

この共変量の組は、すべての臨床の評価項目に同じように当てられ、どの評価項目の解析よりも前に固定されています。ただし、登録はされていません。論文はそう書いています。評価項目ごとに後から都合よく選んだものではない、ということと、事前に登録されていた、ということは別だということです。

やり直したベースラインの TMT を除けば、共変量はすべてランダム化の前に測られています。

6か月後の点数がない人の分は、どうしたのか

ランダム化された355人のうち、6か月後の認知機能の点数が得られたのは278人です。差し引き77人ぶんの値がありません。

それでも主要な解析は355人全員で行われています。欠けた値を、多重代入という方法で埋めているからです。似た人の観測値を当てる方式で50組のデータを作り、それぞれで解析して結果をまとめる、という手続きです。

この方法には前提があります。欠測が、モデルに入っている変数で条件づけたうえで無作為に起きていること。論文は、この仮定は確かめられないと自分で書いています。

30点満点の点数、秒、kg/m²

3つの大事な評価項目は、単位が全部違います。

認知機能の点数は、全体的な認知機能を短く調べる検査(MoCA)の日本語版です。0点から30点までで、高いほうが良いとされています。妥当性が確認された日本語版を、認定された検査者が公表されたマニュアルに沿って実施し、独立に二重で採点しています。

段取りをつける力の検査(TMT)は、完了までにかかった秒数で測ります。短いほうが良い指標です。この検査には part A と part B の2つの部分があり、論文はどちらも報告しています。TMT には、認知機能の検査にあったような訓練・認定・読み上げ原稿・二重採点の仕組みがありませんでした。検査者のあいだの一致の度合いは、どちらの検査でも評価されておらず、実施の録画もされていません。

筋肉の量は骨格筋量指数(SMI)で、単位は kg/m² です。筋肉の量を身長の2乗で割った形の指標で、高いほうが良いとされています。

秒の差については、ひとつ断っておきます。論文の本文には、報告された秒の差がどちらの向きを指すのか(通知を受け取ったグループのほうが速かったのか、遅かったのか)の説明はありません。本文が書いているのは、どちらの部分でもグループ間の差は見られなかった、ということです。

幅(95%信頼区間)の意味

0.03から1.13という幅は、95%信頼区間です。

この幅の読み方は1つに決まっていませんが、実務では「この研究のデータと矛盾しない値の並び」として読むのが分かりやすいです。幅の中にある値は、このデータと両立します。幅の外にある値は、両立しにくい。

差がない状態は0点です。ですから、幅が0を含むかどうかが1つの目印になります。認知機能の点数の幅は0.03から始まるので、0を含んでいません。段取りをつける力の検査と筋肉の量では、幅が0をまたいでいます。

幅が0を含まないことは、「差がある」と確定したことではありません。この研究のデータが0と両立しにくい、ということです。そして次に書くとおり、評価項目が3つあると、この目印の意味は弱まります。

p値の0.039と0.12

p値は、「差がないと仮定したときに、これくらい以上の差が出る起きやすさ」を表す数字です。差が偶然である確率ではありません。

認知機能の点数のp値は0.039でした。これは調整していない値です。

論文は、3つの大事な評価項目をまとめて Holm という手続きで調整した結果も報告しています。そのときのp値は0.12で、統計的に有意ではありません。

Holm の手続きは、複数の検定をまとめて見るときに、「どれか1つでたまたま小さなp値が出る」分を見込んで、基準を厳しくするやり方の1つです。評価項目を3つ測れば、どれか1つで小さなp値が出る起きやすさは、1つだけ測ったときより上がります。それを織り込みます。

ここが、この回の芯につながります。論文は、3つの大事な評価項目にまたがる多重性を抑える方針は事前に決めていなかったと書いています。だから報告されているp値はすべて未調整で、Holm で調整した結果は補足の表に置かれています。調整の手続きは、後から当てられたものです。

そして、3つのあいだの順位や階層も、登録でも計画でも事前に決められていませんでした。後から導入してもいないと書かれています。3つとも全部報告されています。

設計のときに見込んでいた差は1.1点

検出力の計算のところに、もう1つ読みどころがあります。

目標の標本は350人(各群175人)でした。20%の脱落を見込んで280人が評価可能になり、両側の有意水準0.05で、標準化効果量0.34を検出する検出力が80%になる、という計算です。0.34 は、小さいとされる効果と中くらいとされる効果の慣例的な目安の中間の値です。

この0.34を、それぞれの評価項目の単位に戻した値も書かれています。

  • 筋肉の量:0.27 kg/m²
  • 段取りをつける力の検査の part A:9.4秒
  • 同じ検査の part B:31.3秒
  • 認知機能の点数:1.1点

つまり、この試験が認知機能の点数で見つけようとして人数を決めたのは、1.1点の差でした。実際に得られた差は0.58点です。

そして論文は、多重性は織り込んでいないと明記しています。80%というのは各評価項目を単独で見たときの検出力で、3つすべてで効果を示す同時の検出力ではない、ということです。

限界の節にも関連する記述があります。仮定した標準偏差と、実際に観察された標準偏差は違っていて、その違いは TMT の part B で最も大きかった。だから精度は、計画した検出力からではなく、報告された信頼区間から判断するほうが良い、と著者は書いています。

結果を、幅で見る

認知機能の点数

認知機能の点数(30点満点)の、調整後の群間差

まず目盛りだけを見てください。縦の線が引かれているところが0点、つまり2つのグループに差がない位置です。右に行くほど、通知を受け取ったグループの点数が高いことになります。

点が0.58のところにあります。これが推定値です。30点満点の検査で、0.58点ぶんの差という意味です。

横に伸びているのが95%信頼区間で、0.03から1.13までです。下端が0.03なので、幅は0を含んでいません。この研究のデータは、差が0であることと両立しにくい、という形になっています。

ただし、これはこの試験が事前に決めた3つの大事な評価項目のうちの1つです。3つをまとめて Holm の手続きで調整すると、p値は0.039から0.12になり、統計的に有意ではなくなります。幅が0をまたいでいないことと、まとめて見ても差と言えることは、別の話です。

論文は、点数のばらつきから出した「臨床的に意味のある最小の差」を1.0点として引いています。幅の上端1.13はこの1.0点と両立しますが、点推定の0.58は両立しません。著者はこの書き分けを自分でしています。

認知機能の点数(30点満点)0.58(0.03 〜 1.13)
差がない位置0

差がない位置は0点です。点数が高いほうが良いとされる指標で、この0.58点は通知を受け取ったグループの側に出た差です。素点の平均の引き算ではなく、ベースラインの点数・年齢・性別・BMI・教育年数・ApoE2 と ApoE4 の保有を差し引いたあとの差です。ランダム化された355人全員を割り付けどおりに比べた数字で、6か月後の点数がなかった分は統計の手続きで埋められています。

論文のどこ:論文の Results の MoCA の段落(要旨の Findings にも同じ数字があります)。図は Fig. 2、3つをまとめて調整した結果は補足の Table S21 です

認知機能の点数の調整後の群間差は0.58点で、95%信頼区間は0.03から1.13、調整していないp値は0.039でした。通知を受け取ったグループの側に出た差です。

3つの大事な評価項目をまとめて Holm の手続きで調整すると、p値は0.12になり、統計的に有意ではなくなります。

段取りをつける力の検査は、2つあります

動画では、この検査の1つ目だけを出しました。論文には2つ載っています。

段取りをつける力の検査の、調整後の群間差(秒)

まず目盛りを見てください。縦の線が0秒、2つのグループに差がない位置です。単位は秒で、点数ではありません。

1つ目が part A です。推定値は0.16秒、幅はマイナス5.07から5.40までです。幅は0をまたいでいます。p値は0.95でした。

2つ目が part B です。推定値は5.59秒、幅はマイナス3.88から15.05までです。こちらも幅は0をまたいでいます。p値は0.25でした。part B の幅のほうが広いことについては、Table 1 に並ぶ標準偏差が part A より大きいことが関係していそうです。これはこの記事の見方で、論文がそう説明しているわけではありません。著者が書いているのは、仮定した標準偏差と実際に観察された標準偏差の違いが part B で最も大きかった、ということです。設計のときに見込んでいた差も、part A が9.4秒、part B が31.3秒と違っています。

どちらも0をまたいでいますが、ここを「効果がなかった」と読むことはできません。次の節に書くとおり、この検査のベースラインの測定には手続きの問題があり、著者自身が、測定の手続きの問題なのか効果がないのかを区別できないと書いています。

検査の part A(秒)0.16(-5.07 〜 5.4)
検査の part B(秒)5.59(-3.88 〜 15.05)
差がない位置0

差がない位置は0秒です。かかった秒数が短いほうが良いとされる指標ですが、報告された差がどちらの向きを指すのかの説明は論文の本文にありません。ですからこの図から読み取れるのは、どちらの部分でも幅が0をまたいでいる、ということだけです。なお、この検査のベースラインの測定には手続きの問題があり、著者はこの2つの推定値を確認的なものとしては読めないとしています。

論文のどこ:論文の Results の TMT の段落(要旨の Findings にも同じ数字があります)。測り方の問題は Methods の Procedures の節の後半の段落と、Discussion の TMT を扱った段落にあります。標準偏差は Table 1、仮定した標準偏差と観察された標準偏差の違いは Discussion の限界の段落にあります

この検査の測り方には、手違いがありました

ここは動画に入れられなかった部分です。論文は、かなりの分量を使ってこの経緯を書いています。

この検査には、公式の訓練や認定の仕組みがありません。そして、研究者が使える標準の日本語の読み上げ原稿もありませんでした。その結果、検査者全員が、標準とは違う同じ手順でベースラインの検査を実施していました。標準と違っていることに、誰も気づいていませんでした。

これが分かったのは、介入が始まる前です。ですから6か月後のデータも、効果の推定値も、まだ存在していませんでした。検査は標準の手順でやり直されました。

ただし、やり直しは割り付けの後でした。しかも、時間に追われた集団での実施で、どちらのグループかが参加者にも検査者にも分かる状態でした。ほかのすべてのベースラインの測定とは、この点が違います。

標準の手順でのベースラインの値がそろったのは、355人のうち part A で254人、part B で253人でした。やり直しを受けた人は、受けなかった人より若く、認知機能の点数が高かったと書かれています。

人数についてひとつ補足します。本文には群ごとの内訳も書かれていますが、その2つを足すと255人になり、254人とも253人とも一致しません。Table 1 の脚注では254人と253人です。この記事では、合計の254人と253人だけを書いておきます。

論文は、この検査の推定値を全部報告したうえで、確認的なものとしては解釈しないとしています。そして、それは登録した計画がそういう区別を置いていたからではない、とも書いています。後から決めた扱いだということです。この問題は、認知機能の点数、筋肉の量、体組成の評価項目には及んでいません。

考察の節にはこう書かれています。この検査では再現されなかった。ベースラインの実施の問題がその解析を傷めたのか、介入がこの領域に効果を持たなかったのかを区別できない。いずれにせよ、2つ目の検査で裏づけが取れないことは、この差が広い認知機能の恩恵を映しているという見方を弱める。

ですから、この記事も「段取りをつける力には効果がなかった」とは書きません。言えるのは、幅が0をまたいでいて、しかもその数字を確認のためには使えない、ということです。

筋肉の量

筋肉の量の指標(kg/m²)の、調整後の群間差

筋肉の量の指標(kg/m²)-0.01(-0.09 〜 0.07)
差がない位置0

差がない位置は0です。単位は kg/m² で、筋肉の量を身長の2乗で割った指標です。高いほうが良いとされています。推定値はマイナス0.01で、幅は0をまたいでいます。論文は、体組成のほかの測定でも明らかな差は見られなかったと書いています。

論文のどこ:論文の Results の SMI の段落(要旨の Findings にも同じ数字があります)

筋肉の量の指標の調整後の群間差はマイナス0.01 kg/m² で、95%信頼区間はマイナス0.09から0.07、p値は0.88でした。幅は0をまたいでいます。

単位が違うので、同じ目盛りには並べられません

図を3つに分けたのには理由があります。

3つの大事な評価項目の単位は、点、秒、kg/m² です。これを1つの目盛りに並べると、認知機能の点数の幅(0.03から1.13)は、秒の幅(マイナス5.07から15.05)の中でごく狭い線に見えます。狭い線は「精密に測れている」ように見えますが、単位が違うのですから、幅の長さを互いに比べることはできません。

1つの目盛りに混ぜた図は、見た目の長さが比較できるという誤解を作ります。ですからこの記事では、単位ごとに図を分けました。

3つから読み取れることは、1つだけです。幅が0をまたいでいないのは、認知機能の点数だけということです。

事前に決めた3つの外側にも、1つあります

論文には、3つの大事な評価項目のほかに登録された評価項目もあります。虚弱の程度を表すフレイルの指標と、食事のたんぱく質摂取です。

フレイルの指標では、通知を受け取ったグループの側にわずかな差が出ています。マイナス0.19で、幅はマイナス0.37からマイナス0.01、p値は0.043です。

この数字は、多重性の話をもう一段広げます。3つの大事な評価項目だけでなく、ほかに登録された評価項目や、副次評価項目も測られています。測った数が増えれば、どれか1つで0.05を下回る値が出る起きやすさは上がります。論文がすべて報告しているのは良いことですが、読む側は「いくつ測ったか」を数える必要があります。

0.58点は、どれくらいなのか

物差しは、論文の中に2つ出てきます

論文は、まず前置きを書いています。認知機能の点数について、臨床的に意味のある最小の差として普遍的に受け入れられた値は存在しない。推定は方法によって異なる。

そのうえで、2つの値を引いています。この2つは、性質が違います。

1つ目は、1人の点数が動いたと言える最小の幅です。比較できる集団で報告された「最小検出可能変化」という値で、4点とされています。測定の誤差を考えたとき、1人の点数がこれだけ動いていれば「本当に動いた」と言える、という幅です。

ここで論文は、はっきりした書き分けをしています。この4点は1人の変化得点の信頼性を表す閾値であり、この試験の推定値は群の平均の対比である、と。つまり4点は、0.58点と直接並べて「届いていない」と言うための物差しではありません。性質の違うものです。論文は、自分たちの推定値はこの4点を大きく下回ると書いたうえで、同じ文の中でその違いを断っています。

2つ目は、点数のばらつきから出した、臨床的に意味のある最小の差です。1.0点とされています。論文は、この1.0点をこの研究の推定値と直接並べています。

そして論文は、この1.0点について、もう一段細かい書き分けをしています。1.0点は、信頼区間の上端である1.13とは両立するが、点推定とは両立しない。

言い換えると、こうなります。この研究のデータは「1.0点の差がある」という値を完全に排除していません。幅の上端がそれを超えているからです。しかし、いちばんありそうな値として出ている0.58点は、1.0点に届いていません。

動画では、1.0点のほうだけを出しました。「0.58点は、そこに届きません」と言ったのは、点推定のことです。

著者はこう結んでいます。したがって、この知見は個人にとって臨床的に意味のある改善としてではなく、認知機能の点数の集団の分布の小さなずれとして読む。臨床的な意味は定かでない。

著者の但し書き「小さなずれでも無意味とは限らない」

ここも動画に入れられませんでした。論文は、上の結論のすぐ後ろに、逆向きの但し書きを置いています。

そのようなずれが、取るに足らないとは限らない。ある観察研究のコホートでは、30点満点の検査で30点ではなく29点だったことが、記録された認知症の診断の多さと関連していた。調整後のハザード比は1.43で、95%信頼区間は1.11から1.84。1点の違いでも、将来の記録と関連していた例がある、ということです。

ただし、著者は同じ段落でこうも書いています。そのベースラインの比較では、介入で0.58点動いたことが何を意味するかは決まらない。

この2つは、どちらも論文に書かれています。片方だけを取り出すと、別の記事になってしまいます。「1点の差でも将来の認知症と関連していた」だけを読めば大きな話になり、「0.58点では意味が決まらない」だけを読めば小さな話になります。著者は両方を、同じ段落に並べて置いています。

動画に入らなかった数字

ここから先は、論文に載っているけれど動画では扱えなかった数字です。順番に並べますが、多くは探索的か、後から行われた解析です(論文がそう書いています)。登録されていた副次評価項目のように、そう書かれていないものもあります。どれがどれかは、該当の節に書きます。

解析集団を変えると、数字が動きます

解析集団を変えた感度分析では、向きは一貫していました。そのうえで、欠測を埋めずに値のある人だけで解析したときの差は0.61点、手順を守った人だけで解析したときの差は0.92点でした。どちらも、割り付けどおりに全員を比べた0.58点より大きい値です。

ここで注意が必要です。手順を守れるかどうかは、くじ引きで決まったことではありません。

順守度との交互作用

欠測を埋めずに解析した278人の中で、割り付けと、「手順を守った群に入るか、入らなかったか」を掛け合わせた項を入れた計算も行われています。この交互作用は1.60で、幅は0.39から2.82、p値は0.010でした。

論文は、この解析についてはっきり書いています。順守はランダム化の後に決まる変数である。だからこの解析は探索的で、因果ではない。手順を守った人の推定値が大きいことは、生物学的な効果が強いことの証拠ではない。

何点以上改善した人の割合

後から行われた反応者解析もあります。欠測を埋めていない278人で、認知機能の点数が改善した人の割合です。

  • 1点以上の改善:140人中84人(60.0%)と、138人中57人(41.3%)
  • 2点以上の改善:140人中58人(41.4%)と、138人中37人(26.8%)
  • 3点以上の改善:140人中42人(30.0%)と、138人中18人(13.0%)

並べると、大きい数字に見えます。実際に見出しに使いやすい形です。

だからこそ、論文が自分で添えている一文が大事になります。これらの閾値は、事前に決めたものでも、臨床的に重要と確立したものでもありません。1点、2点、3点という区切りは、結果を見てから引かれたものです。

この記事では、この数字を図にしていません。図にすると、事前に決めた解析と同じ重みで見えてしまうからです。

機器から取れた行動の数字

登録されていた副次評価項目は、機器から取れる1日の歩数と総睡眠時間です。手順を守った210人で、通知が出る前の最初の28日と、通知がまだ届いていた最後の28日を比べています。

自然な単位での変化の群間差は、1日あたり696歩、1日あたり6.6分の活動時間、1晩あたり11.6分の睡眠でした(活動時間は登録された副次評価項目ではありません)。

ここに論文の但し書きが付いています。歩数と睡眠では、両方のグループとも減っていました。差が表しているのは増加ではなく、減り方の小ささです。活動時間だけは、通知を受け取ったグループで増え、測定だけのグループで変わりませんでした。

もう1つ。この計算には共変量が入っていないので、ほかの調整後の差とは比べられないと図の注に書かれています。

そして、機器を続けて着けていたのは通知を受け取ったグループだけです。論文は、この行動の差の一部は、通知ではなく測定されていることへの反応を映している可能性があると書いています。

食事の数字

手順を守った210人での探索的な解析では、たんぱく質の摂取が増えていました。調整後の差は1日あたり7.97グラムで、幅は4.90から11.03、p値は0.0001未満です。脂質、食物繊維、総エネルギーもやや増え、炭水化物には明らかな差がありませんでした。

ここにも但し書きがあります。ベースラインの摂取量は、年齢と性別を合わせた全国平均に近い値でした。ですからこれは、不足を補ったのではなく、平均を超える量まで増やしたことになります。

通知を受け取るグループの178人のうち、任意の食事の部分に参加したのは128人(71.9%)でした。そのうち121人(94.5%)が、たんぱく質を調整した食品の受け取りも選んでいます。それぞれがどれだけ受け取り、どれだけ食べたかは記録されていません。

行動の変化と、点数の変化

手順を守った人たちで、6か月の行動の変化と認知機能の点数の変化の関連も調べられています。運動の変化、睡眠の変化、たんぱく質摂取の変化を同時に1つの計算に入れた形です。

運動の増加が大きいほど点数の改善が大きい、という関連が出ました。標準化されたβは0.24、p値は0.0086です。睡眠の変化(β=0.16、p=0.36)とたんぱく質摂取の変化(β=−0.03、p=0.87)は残りませんでした。

論文は、この解析の読み方をかなり強く限定しています。モデルは観察的である。2つのグループで異なる条件のもとで記録された行動の測定に基づいている。だから、媒介の解釈(この経路を通って効果が出たという読み方)は支えられない。行動の変化は、経路の証拠ではなく関与の証拠として読むのが最も良い。

そして、活動・睡眠・栄養の要素は一緒に届けられ、栄養は任意でした。論文は、認知機能の点数の差をどれか1つの要素に帰することはできないと書いています。機器だけの研究でも、食品だけの研究でもない、ということです。

部分集団

部分集団の解析もありますが、正式な検定では違いの証拠が出ていません。ベースラインの認知の状態で分けたときの交互作用のp値は0.92、ApoE4 の保有では0.43、その組み合わせでは0.33でした。

いちばん離れて見えた部分集団は、軽度認知障害の疑いと ApoE4 の保有の両方を持つ人たちで、7人と10人という人数です。p値は0.038でした。論文は、この結果は非常に小さい人数に基づき、多重性の補正がなく、対応する交互作用の検定に支持されず、臨床の推論には解釈できないと書いています。

起きた不具合

機器、食事のアプリ、たんぱく質を調整した食品に関連する重い有害事象は、どちらのグループでも報告されていません。

介入に関連しうる重くない事象として挙がっているのは、機器が触れる部位の軽い皮膚のかぶれと、毎日の食事の記録に伴うストレスです。測定だけのグループでも、少数が軽い皮膚のかぶれを報告しています。介入に関連する有害事象で中止した人はいませんでした。

6か月後の使いやすさの点数は両方のグループで似ていましたが、正式な比較は行われていません。

人数が、そろっていないところ

論文を通して読むと、人数が合わない箇所がいくつかあります。読む側が足し算をすれば気づく範囲のものです。

1つ目。段取りをつける力の検査をやり直した人数です。本文は、標準の手順でのベースラインの値がそろったのは part A で254人、part B で253人としています。ただし同じ文の括弧の中にある群ごとの内訳を足すと255人で、254人とも253人とも一致しません。Table 1 の脚注は254人と253人で、表の中の人数を足した値もそれに合います。

2つ目。通知が届いた人数です。活動と睡眠の通知が届いたのは146人、栄養の通知が届いたのは118人と書かれています。一方で、任意の食事の部分に参加したのは128人です。通知を受け取るグループは178人ですから、146人との差は32人あります。118人と128人の差は10人です。この差について説明する記述は、論文の本文にはありません。通知の発行が機器の着用と強く結びついていたことは書かれていますが、人数の対応関係は書かれていません。

3つ目。ベースラインの釣り合いです。本文は、ベースラインの特徴は釣り合っていたと書いています。一方で Table 1 の ApoE2 の行は、11人(6.2%)と20人(11.3%)です。この項目は共変量として計算に入っていますが、表の数字としては倍近い開きがあります(この割り算はこの記事のもので、論文が書いているものではありません)。

いずれも、論文が数字を隠しているという話ではありません。全部載っているから、読む側が突き合わせられるという話です。

資金を出したのは誰で、何をしたのか

ここは動画では16文字のカードに収まらなかった部分です。論文の書き方に沿って、分けて書きます。

試験のスポンサーは東京大学で、試験の最終責任を持っていました。

そのうえで、3社が関わっています。役割は3社で違います。

  • NH Foods:東京大学の社会連携プログラムに資金を出し、たんぱく質を調整した食品を提供しました
  • Google:腕時計型の機器と、研究寄付を提供しました
  • 三井不動産:募集の名簿を管理し、評価の場所を提供しました

三井不動産については、論文の資金提供者の役割の節にお金を出したという記述はありません。ただし、要旨の資金の欄には3社ともが並んでいます。

次が、いちばん大事な書き分けです。

NH Foods と Google の社員は、この論文の共著者です。そしてその立場で、試験の着想と設計、原稿の確認に関与しています。

それを超えては、資金提供者は試験の実施、データ収集、解析や解釈、報告の執筆に関与しておらず、個人単位のデータにもアクセスしていません。責任著者が全部のデータにアクセスでき、投稿の判断の最終責任を持ったと書かれています。

この2つは、両方書かないと形が変わります。「会社は実施にも解析にも関わっていない」だけを読むと、関与がなかったように見えます。「会社の社員が設計に加わっている」だけを読むと、すべてが会社の手の中にあるように見えます。論文はその両方を、続けて書いています。

そして、設計に加わったと書かれているのは2社です。3社をまとめて「設計に関わった」と書くことはできません。

利益相反の節も、書き分けがあります。責任著者は、NH Foods が資金を出す東京大学の社会連携プログラムを率いています。6人の著者が NH Foods の社員、3人が Google または Google LLC の社員です。三井不動産については「所属している」という書き方で、4人が該当し、同社が募集の運営を支援し一部の評価の場所を提供したと添えられています。社員という語は使われていません。

この構図は、研究を無効にするものではありません。ただ、読む側が知っておくべき条件です。

この研究では言えないこと

動画では限界を1つに絞りました。評価項目の話です。ここでは広げます。著者が自分で書いている限界も含めます。

1. 事前に決めた大事な評価項目が3つあって、順番もまとめ方も決まっていません

これがこの回の芯です。

認知機能の点数、段取りをつける力の検査、筋肉の量。3つとも同格の主要な評価項目(co-primary)として登録されていて、どれかを下位に置く形ではありません。論文は、代謝を通じた筋肉と脳のつながりを想定したわけではないとも書いています。

そして、3つのあいだの順位や階層は、登録でも計画でも事前に決められていません。後から導入してもいません。3つにまたがる多重性を抑える方針も、事前に決められていません。

考察にはこう書かれています。この認知機能の結果は、3つの大事な解析のうちの1つであって、単独の確認的な知見ではない。まとめて考えると、もはや統計的に有意ではない。

Research in context の節では、著者はこの設計が決められないことを3つ並べています。非盲検で評価も盲検化されていないこと。3つの評価項目が、順位も多重性の方針もなく co-primary として登録されたこと。そして、主要な比較に続く探索的な解析はすべて、差が出た1つの評価項目の上に作られていることです。

最後の点は、この記事の「動画に入らなかった数字」の節全体に効いてきます。順守度との交互作用、部分集団、行動との関連、反応者解析。どれも認知機能の点数の上で行われています。論文は、その選択が主要な結果に従ったもので、事前の計画ではないと書いています。

2. 測ったのは6か月後の検査の点数です

評価が行われたのは、ベースラインと6か月後です。登録された評価項目の中に、認知症になったかどうかは入っていません。

著者はこう書いています。これらのデータは、身体的な危険が濃い高齢者の集まりでの短期の認知機能の点数の変化について知らせるもので、認知症の予防を直接には知らせない。

Research in context の節にも、こうした自動の通知を使うプログラムが認知機能の低下を防ぐことを立証するものではない、と書かれています。

6か月という期間については、長期の持続については語れないとも書かれています。

3. どちらのグループかが分かる状態でした

割り付けを隠す仕組みが用意されていないので、選択の偏りは除外されません。著者は、0.58点は小さいので、控えめな偏りでも問題になると書いています。

6か月後の評価も盲検化されていないので、測定・期待・採点の効果を除外できません。認知機能の検査には二重採点などの品質管理の手続きがありましたが、著者は、それはこの懸念を減らすが取り除かない、効果の推定値はそれに応じて不確かなものとして読むべきだ、と書いています。

4. 2つ目の検査では裏づけが取れていません

前に書いたとおりです。段取りをつける力の検査では再現されませんでした。そして、ベースラインの実施の問題がその解析を傷めたのか、介入がこの領域に効果を持たなかったのかを区別できません。

著者は、いずれにせよ、2つ目の検査で裏づけが取れないことは、この差が広い認知機能の恩恵を映しているという見方を弱めると書いています。

5. 行動の数字は、通知が届いているあいだのものです

行動と食事の評価項目は、通知がまだ届いているあいだに測られました。ですからそれは、通知が止まった後も続いた行動ではなく、通知のもとでの行動を表しています。

また、機器を続けて着けていたのは片方のグループだけです。測定されていることへの反応は、こうした行動の差の原因として認められているものだと、著者は書いています。

6. どの要素が効いたのかは分かりません

活動、睡眠、栄養の要素は一緒に届けられ、栄養は任意でした。論文は、認知機能の点数の差をどれか1つの要素に帰することはできないと書いています。機器だけの研究ではありません。

7. 誰に当てはまる話なのか

参加者はスマートフォンを持っていて、6か月間手首に機器を着ける意思がありました。そして、すでに自分の健康管理にウェアラブルを使っていた人は除外されています。著者は、だからこの知見は、そうした機器を新しく導入することについてのもので、使い続けることについてのものではないと書いています。

ほかにも並んでいます。単一施設で、日本の郊外です。人種と民族は、集団が同質なので記録されていません。社会経済的な位置は教育年数を超えては測られておらず、障害も評価されていません。施設で常時の介護を受けている人は除外されているので、大きな機能の制限がある高齢者や、違う社会的な状況にいる高齢者についてはほとんど語らない、と書かれています。

性別については、すべての計算で共変量に入っていますが、性別ごとの効果を推定する検出力はなく、女性と男性で分けた結果は報告されていません。参加者の3分の2は女性です。

農村や資源の少ない状況、デジタルの習熟が低い高齢者にどこまで広がるかは分からないとも書かれています。拡張性については、記録していない技術的な支援の必要性によってさらに限定され、自動の設計はデジタルの利用や慣れが限られる場所では効きにくいかもしれないと述べられています。

8. 集められていない情報があります

併存疾患のデータは系統的に集められていません。管理されている高血圧や糖尿病がある人は参加できましたが、その割合は分からず、グループごとに報告できません。効果を変える要因として調べることもできません。

食事の部分についても、食品そのものの摂取量は測られておらず、ほかのたんぱく質の供給源との比較も行われていません。

9. 著者は、どう結んでいるか

考察の最後はこうです。全体として、この試験は、健康な老いのための、拡張可能で自動の、ウェアラブルを中心にした多領域のプログラムの実行可能性を支持する。認知機能の点数の差が持続し、臨床的に重要かどうか、そしてどの要素が寄与するかを確かめるには、より大きく長い多施設の試験が必要である。

要旨の結論も同じ向きです。この介入は、多重性の調整に耐えず、臨床的な意味も定かでない、全体的な認知機能の検査の点数の小さな差と関連していた。ほかの2つでは差は見られなかった。より大きく、より長く、盲検化された試験が必要である。

元の論文のどこを見ればよいか

この記事で使った数字は、すべて論文の中にあります。探す場所を書いておきます。

  • 誰が参加したか、どうやって集めたか:Methods の Study design and participants の節。絞り込みの流れ図は Fig. 1
  • くじ引きの仕組みと、盲検化されていないこと:Methods の Randomisation and masking の節
  • 通知の中身、目標の段階、たんぱく質の部分と食品の扱い:Methods の Procedures の節
  • 段取りをつける力の検査の測り方の問題:Methods の Procedures の節の後半の段落と、Discussion の同じ検査を扱った段落
  • 3つの大事な評価項目の定義と、順位を決めていないこと:Methods の Outcomes の節
  • 検出力の計算(1.1点など)、解析集団の定義、共変量、多重代入、多重性の扱い:Methods の Statistics の節
  • 資金提供者の役割:Methods の Role of the funding source の節。会社ごとの所属は Declaration of interests の節、資金の一覧は要旨の Funding 欄
  • 参加者の内訳とベースラインの特徴:Results の最初の段落と Table 1
  • 認知機能の点数の結果(0.58点、幅、p値、Holm 調整後の0.12):Results の MoCA の段落と Fig. 2。まとめて調整した結果は補足の Table S21
  • 段取りをつける力の検査の2つの数字:Results の TMT の段落
  • 筋肉の量とフレイルの指標:Results の SMI の段落
  • 解析集団を変えた感度分析と順守度との交互作用:Results の感度分析の段落と Fig. 3
  • 何点以上改善した人の割合:Results の反応者解析の文
  • 歩数・活動時間・睡眠の数字:Results の混合モデルの段落と Fig. 4
  • たんぱく質の摂取:Results の栄養の段落と Fig. 5
  • 行動の変化と点数の変化の関連:Results の変化得点のモデルの段落と Fig. 6
  • 部分集団:Results の効果の修飾の段落と Fig. 7
  • 有害事象:Results の最後の段落
  • 2つの物差しと、著者の但し書き:Discussion の認知機能の点数の物差しを扱った段落
  • 限界の一覧:Discussion の後半の段落と、Research in context の節

この論文はクリエイティブ・コモンズの表示ライセンスで公開されているオープンアクセスの論文です。DOI のリンクから全文を読めます。補足の資料(Supplementary)には、適格条件の一覧、通知の表、解析集団ごとの結果、Holm で調整した結果などが入っています。

見方を練習するために

この回で練習になるのは、「数字の見せ方」を見る目です。

この論文は、事前に決めた大事な評価項目を3つとも報告しています。順番を決めていないことも、まとめて評価する方法を決めていないことも、後から Holm の手続きで調整したことも、自分で書いています。隠していません。

それでも、外に出ていくときには、差が出た1つが前に来ます。0.58点という数字と、幅が0をまたいでいないことは使いやすい。0.12という調整後のp値と、「臨床的な意味は定かでない」という著者の言葉は、使いにくい。同じ論文から、強い言い方も弱い言い方も作れてしまいます。

ですから、読む側が数えるべきことは2つです。評価項目はいくつあったか。そして、その差は何点満点の何点か。この2つは、専門知識がなくても数えられます。

この見方に一番近い本として、『統計でウソをつく法』を挙げておきます。数字そのものではなく、グラフや数字の見せ方で印象がどう変わるかを扱った本です。どれを前に出し、どれを後ろに置くかで、同じ数字の読み方が変わる。その仕組みが分かると、見出しと論文の本文のあいだにある距離が見えるようになります。この記事のページでは、この書名にアフィリエイトのリンクを付けています。

最後にもう一度だけ書いておきます。この記事は、腕時計型の機器も、たんぱく質を調整した食品も、サプリメントも勧めていません。認知症を防げるか防げないかについても、何も言っていません。ここで扱ったのは、一つの論文の中にある数字と、その幅の読み方だけです。

元の論文

Sakurai K ら. eClinicalMedicine. 2026.
https://doi.org/10.1016/j.eclinm.2026.104212

もっと知りたい人へ

PRこの記事には広告(アフィリエイトのリンク)を含みます。

『統計でウソをつく法』