動画で話したこと

リールでは、ここまでを話しました。ポリープを取ったあとの次の大腸カメラを、5年後にするか3年後にするかを比べた試験です。ヨーロッパの8か国で、リスクの高いポリープを取り切った1万799人をくじ引きで2つに分けました。5年半の時点で大腸がんと診断された人は、どちらのグループも1パーセント未満でした。ただしこれは非劣性試験、つまり「決めた幅より大きくは悪くないか」を確かめる形の試験です。決めた幅は0.7ポイント。差の信頼区間の上限は0.68ポイントで、著者自身が「かろうじて条件を満たした」と書いています。そして、この研究に入ったのは高リスクのポリープを取り切った40歳から74歳の人だけで、およそ3分の2は便の検査が陽性で内視鏡を受けた人です。

短い動画で話せたのは、ここまでです。この記事の柱は非劣性の読み方です。非劣性とは何を確かめる形なのか。なぜ悪くなる側の端だけを見るのか。決めた幅0.7ポイントは、どこから来た数字なのか。そして、上限0.68が幅のすぐ下だったことは、何を意味するのか。

もう1つ、動画には入れられなかった話があります。この論文の付録(Supplementary Appendix)には、本文だけでは分からないことが書かれています。本文が「主解析」と呼び、上限0.68という非劣性の判定を出している逆確率重み付けの解析は、付録では「計画外の追加解析」と呼ばれています。あらかじめ計画されていた解析でも、上限は0.383で0.7を下回っていました。いっぽう、本文が1行で「主解析と同様」と済ませた感度解析は、上限0.69まで来ています。3割から4割の人は5年の検査に来ておらず、その分は統計の重み付けで補われています。その重みに何が入っていて、何が入っていないのか。

この記事の数字と事実は、この論文の本文と付録に書かれていることだけをもとにしています。この論文より後の研究や、同じ EPoS 計画の別の研究(低リスクのポリープを扱う EPoS I、鋸歯状ポリープだけの人を扱う EPoS III)の結果は使いません。

誰を、どう分けて、いつ測ったか

この研究は観察研究ではありません。参加者をくじ引きで2つに分けたランダム化比較試験です。しかも、まだ進行中の試験です。

  • 試験の形:ランダム化比較試験であり、同時に非劣性試験です。本文の言葉では randomized, noninferiority trial です。
  • 場所と時期:ヨーロッパ8か国(オーストリア、デンマーク、オランダ、ノルウェー、ポーランド、ポルトガル、スペイン、スウェーデン)の49の内視鏡センターで行われました。登録の受け付けは2015年4月から2020年3月まででした(EPoS の試験全体の登録期間として書かれています)。
  • どの人が、この試験に入ったか:40歳から74歳で、大腸カメラでポリープを完全に取り切った人です。その内視鏡には条件がついています。盲腸まで到達していること、腸の洗浄がじゅうぶん(Boston bowel preparation scale がすべての区域で2点以上)であること、見つかったポリープを全部取り切っていること。担当したのは、内視鏡の質の管理プログラムに参加している医師です。
  • そのうえで、取ったポリープの種類で振り分けられました:高リスク腺腫があった人がこの試験(EPoS II)に入ります。高リスク腺腫の定義は、直径10mm以上の腺腫が1つ以上、高度異型のある腺腫、絨毛状の成長パターン、または種類を問わず3個から10個の腺腫のいずれかです。鋸歯状ポリープを一緒に持っている人も入ります。低リスクの腺腫だった人は別の試験(EPoS I)に、鋸歯状ポリープだけで高リスク腺腫がない人は、1つのグループだけの研究(EPoS III)に回っています。
  • 除かれた人:遺伝性のがん症候群(リンチ症候群、家族性大腸ポリポーシス、鋸歯状ポリポーシスなど)、炎症性腸疾患、大腸の手術歴や大腸がんの既往、過去に腺腫と言われたことがある人、直径10mm以上の鋸歯状ポリープ(脾曲より近位なら5mm以上)、腺腫を10個より多く取った人、9mmより大きいポリープを回収できなかったか病理に出していない人、心疾患が重い人、化学療法や放射線療法の継続中の人、長期の医療・看護が必要な状態の人です。
  • どう分けたか:1対1のランダム割り付けです。専用のソフトを使い、施設、性別、年齢(40〜55歳、56〜65歳、66〜74歳)で層別しています。片方は、ポリープを取った5年後と10年後に内視鏡を受ける計画。もう片方は、3年後と5年後と10年後に受ける計画です。この記事では、前者を5年後に検査を受けるグループ、後者を3年後にも検査を受けるグループと呼びます。2回目からは「5年のグループ」「3年のグループ」と短く書きます。どちらも割り付けの名前で、実際にそのとおり検査を受けたかどうかとは別です。3年後にも検査を受けるグループも、5年後には受けます。本文は、その理由を「5年時点の累積発生率を公平に比べ、リードタイム・バイアス(見つける時期が早いだけで結果がよく見えること)を避けるため」と書いています。どちらのグループも10年後に受けるので、これは「5年に1回か3年に1回か」という繰り返しの間隔の比較ではなく、最初の経過観察の内視鏡をいつにするかの比較です。
  • いつ受けたものを「予定どおり」と数えたか:予定日の前後6か月以内です。新型コロナの流行期は前後9か月に広げています。その窓の外で受けた検査と、症状や所見をきっかけに受けた検査は「予定外の内視鏡」として別に記録されました。
  • 何を測ったか:主な評価項目は10年時点の大腸がんの累積発生率です。今回の報告はその途中、5.5年時点(5年+プロトコルで許した6か月の窓)の中間解析です。大腸がんは結腸または直腸の腺がんと定義され、神経内分泌腫瘍と扁平上皮がんは評価項目の事象に数えません。死亡は競合リスクとして扱われています。追跡の打ち切りは、大腸がんの診断、5年時点のサーベイランス内視鏡、5.5年のうち最も早い時点です。各施設の担当者が毎年と追跡終了時に電子診療記録を照会し、検査の所見、新しい大腸がんの診断、死亡を記録しました。参加国はどれも単一支払者の国民医療制度と固有の患者番号がある国なので、追跡不能はごく少数です。

ここで、この記事でいちばん気をつけて書き分けたい区別があります。割り付けどおりの比較か、実際に受けたかで分けた比較かです。

この論文が報告しているのは2つの解析で、どちらもグループの分け方は割り付けのままです。実際に検査を受けた人だけを取り出してグループを組み替えた比較(per-protocol 解析)は、本文にも付録にも出てきません。ただし、2つの解析は「検査に来なかった人をどう扱うか」が違います。

  • あらかじめ計画されていた解析(ITT、割り付けどおり):ランダム化された1万799人全員を含みます。生きていて、大腸がんと診断されず、5年時点の内視鏡も受けなかった人は「大腸がんではない」とみなし、5.5年または試験からの離脱日の早いほうで打ち切ります。
  • 本文が「主解析」と呼んでいる解析(逆確率重み付け、IPW):結果の計算に直接入るのは、5年時点の検査を受けた人と、それより前に大腸がんと診断された人または亡くなった人です。5年まで大腸がんの診断も死亡もなく、検査を受けなかった人は重み0で、直接は入りません。そのぶん、検査を受けた人の重みを増やして代表させています。年齢のデータが欠けていた13人(5年のグループ9人、3年のグループ4人)は除かれ、この解析の集団は1万786人になります。

つまり主解析は、割り付けでグループを分けたまま、検査に来た人のデータを重み付けして全体を推し量るという形です。この作りは、あとの「3〜4割は5年の検査に来ていない」の節でくわしく書きます。

そして、予定どおり受けた人の割合は、著者自身が第一の限界に挙げているところです。3年のグループの3年時点は79.6%、5年のグループの5年時点は70.4%、3年のグループの5年時点は64.6%でした。予定外の内視鏡を受けた人は、5年のグループ366人(6.8%)、3年のグループ482人(8.9%)です。ですから「5年のグループ」「3年のグループ」という呼び名は、割り付けの名前として使っています。全員がそのとおりに動いたわけではありません。

人数の流れを見ておきます。

何人を調べ、何人が5年の検査に来たか

はじめに、適格かどうかを調べられた人が1万945人です。そこから5人が外れ(登録の違反2人、登録のずれ3人)、1万940人が登録時の大腸カメラを受けました。

さらに141人が外れて、くじ引きで2つに分けられたのが1万799人です。外れた理由は、登録の違反75人、登録のずれ64人、同意の撤回1人、そのほか1人でした。内訳は5年のグループ5398人、3年のグループ5401人で、ほぼ半分ずつです。

3年のグループは、まず3年後の検査があります。予定どおり受けたのは4299人(79.6%)でした。5年のグループにはこの回がありません。プロトコルで決めた違いは、この3年後の回があるかないかだけです。

5年時点の検査を実際に受けたのは、合わせて7290人です。5年のグループ3801人(70.4%)、3年のグループ3489人(64.6%)。つまり3割から4割の人は、5年時点の検査を受けていません。著者はこれを限界の1つ目に挙げています。

注意が必要なのは、解析に使った集団の人数がこの4段とは別に数えられていることです。重み付けの主解析に入ったのは1万786人(年齢のデータが欠けていた13人を除いた数)、重みを計算するロジスティック回帰に入ったのは1万398人(そこから、5年より前に大腸がんと診断されたか亡くなった388人を除いた数)です。付録の別の表には「5年の検査を受けた人 7678人」という数も出てきますが、その表の脚注によると、この7678人には5年の検査より前に大腸がんになった人や亡くなった人が含まれています。実際に検査を受けた人数は7290人です。

適格性を評価された人10945人
登録時の大腸カメラを受けた人10940人
くじ引きで2つに分けられた人10799人
5年時点の検査を実際に受けた人7290人

人数だけを表した図です。リスクの大きさを表すものではありません。解析に使った2つの集団(主解析の1万786人と、重みを計算するモデルに入った1万398人)は数え方が違うので、この4段には入れていません。本文で説明します。

論文のどこ:論文の Fig. 1(Screening, Randomization, and Follow-up)。5年時点の検査を受けた人数は、この図のいちばん下の枠にあります

最後に、検査の回数そのものです。登録から追跡終了までに行われた大腸カメラの総数は、5年のグループが4434件、3年のグループが8614件でした。5年のグループでは4180件(48.5%)少なかったことになります。これは検査の負担の話であって、この記事は検査を減らすことを勧めるものではありません。

この数字は、何を指しているか

結果を読む前に、目盛りを合わせます。この論文は数字の種類が多く、ここを飛ばすと取り違えます。

0.77%と0.82%は、累積発生率です。 5.5年の追跡のあいだに大腸がんと診断された人の割合を、追跡した時間の長さと、死亡という競合する出来事を考慮して推定した値です。Table 2 の脚注は「追跡時間を考慮して推定した累積発生率であり、直接の割合とは一致しないことがある」と書いています。実際、5年のグループの25人を5389人で割ると0.46%くらいですが、報告されている値は0.77%です。単純な割り算ではありません。さらにこの2つは、5年の検査に来なかった人の分を重み付けで補った推定値です。

差の単位は、パーセントポイントです。 0.77%と0.82%の差が −0.05ポイントです。パーセントとパーセントポイントは別ものです。「0.05%減った」ではありません。

差の向きが決まっています。 Table 2 の脚注と付録の表の脚注に、差は「5年のグループの累積発生率 − 3年のグループの累積発生率」と書かれています。0より大きければ、間隔が長いほう(5年のグループ)のリスクが高い、という向きです。この記事でも、プラスは「5年のグループのほうが多い側」として読みます。

0.68は、片側99.12%信頼区間の上限です。 ここが、この論文の読み方でいちばん引っかかるところです。ふつう論文の括弧の中には、下の端と上の端が両方入っています。この論文の大腸がんの差については、上限だけが報告されています。下限は本文にも付録にもありません。片側の信頼区間は「上へどこまで行きうるか」だけを示す形なので、これは書き忘れではなく、設計どおりです。

なぜ99.12%という見慣れない数字なのかも、本文に書かれています。 この5年時点の中間解析については症例数の計算をしていません。そのため、中間解析と10年後の最終解析のあいだで第一種の過誤が積み上がらないように、O'Brien–Fleming 型のアルファ消費関数を使い、非常に厳しい片側99.12%信頼区間を使ったと説明されています。10年後の最終解析では95.33%信頼区間を使い、全体で5%に保つ予定です。

ここで言う第一種の過誤は、「本当は差がないのに差がある」と判断してしまうことではありません。 非劣性試験が抑えたいのは、向きの違う誤りです。本当は、5年のグループの大腸がんのリスクが3年のグループより0.7ポイント以上高いのに、非劣性だと判断してしまうこと。これがこの試験の第一種の過誤です。ちょうど0.7ポイントの場合も、ここに含まれます。この試験が確かめているのは差の有無ではなく、差の信頼区間の上限が0.7を下回るかという1本の線だからです。ですから、中間解析と最終解析で判定を2回行うことで積み上がるのも、「大きくは悪くない」と言いすぎてしまう側の誤りになります。厳しい区間を使うと幅は広くなり、上限の数字は大きくなります。つまり99.12%という設定は、非劣性の判定が出にくくなる方向の設定です。上限0.68は、その厳しい設定のもとでの数字です。

2つのグループの大腸がんのリスクを比べるところに、倍率は使われていません。 ハザード比も相対リスクも出てきません。本文も付録も、グループとグループの比較はすべて「累積発生率の差(パーセントポイント)」で書かれています。ですから、この比較を「何倍」という形には直せません。この記事でも、ポイントを倍率やパーセントに読み替えません。なお、付録にはオッズ比が出てきます(Table S7 と Table S8)。これは検査に来やすいかどうかを扱う重み付けのモデルの値で、大腸がんの起こりやすさを2つのグループで比べた値ではありません。あとの節で紹介するポーランドのオッズ比21.02も、この重みのモデルの値です。

副次的な評価項目の95%信頼区間は、多重性の補正をしていません。 本文は「信頼区間の幅は多重検定について補正しておらず、治療効果を推論するために使うべきではない」と書いています。付録にも「信頼区間は多重性について補正していない」という注記があります。あとで進行腺腫などの数字を出しますが、その幅から「効いた」「効かなかった」を読み取ることはできません。

「1パーセント未満」は、どの解析でも成り立ちます。 重み付けの主解析では0.77%と0.82%、あらかじめ計画された解析ではどちらのグループも0.48%。著者自身も「この試験の患者の99%以上は、ポリープ切除から5年以内に大腸がんと診断されなかった」と書いています。

「非劣性」は、何を確かめる形か

ここがこの記事の柱です。動画では8場面、約50秒しか使えませんでした。順に4つに分けて書きます。

1. 非劣性は、優越性でも同等性でもない

試験の形には、大きく3つの立て方があります。

  • 優越性:新しいやり方のほうがよいことを示す形。差がないという値(引き算の指標なら0)から、幅がまるごとよい側に外れていることを見る。
  • 同等性:2つのやり方がどちらの側にも大きく違わないことを示す形。許せる差の幅を両側に決めて、幅がその両方の内側に収まっていることを見る。
  • 非劣性:新しいやり方が決めた幅より大きくは悪くないことを示す形。悪くなる側にだけ幅を決めて、そこに収まっていることを見る。

この試験は3つめです。本文は「この試験は、より長い間隔(5年後から始める)が、いま推奨されている短い間隔(3年後から始める)に非劣性かを検定するために設計された」と書いています。つまり、確かめようとしたのは「5年後から始めるやり方は、決めた幅より大きくは悪くないか」です。「同じか」でも「よいか」でもありません。

非劣性が示されても、言えないことがあります。3年後と5年後が同じだ、とは言えません。 5年後のほうがよい、とも言えません。そして、差が決めた幅の中のどこにあるのかも決まっていません。示されるのは「決めた幅よりは悪くない」、つまり幅の内側にいることだけです。

2. なぜ、悪くなる側の端だけを見るのか

この試験がやりたかったことから考えると、片側だけを見る理由が分かります。本文の背景には、大腸カメラは費用がかかり、体への負担があり、合併症の危険もあるので、間隔を長くできれば費用対効果は改善し、患者の負担は減るはずだ、と書かれています。間隔を延ばせば検査の回数が減ることは、この試験でも数えられています(5年のグループ4434件、3年のグループ8614件)。分からないのは、延ばしたときに、がんがどれだけ増えるかです。

だから見るのは「5年のグループのほうが多くなる側に、どこまで行きうるか」という端です。差は「5年のグループ − 3年のグループ」で定義され、0より大きければ5年のグループのリスクが高い。その上の端だけを見て、あらかじめ決めた線を下回れば「大きくは悪くない」と判断する。この設計だから、報告されるのが片側の上限だけになります。

逆に言えば、この結果から「5年のグループのほうが少ない」とは示せません。 差の推定値は −0.05ポイントで、たしかに5年のグループのほうが少ない向きですが、下の端は報告されておらず、上の端は0.68まで伸びています。著者の結論も「5年のグループで高いようには見えなかった」という書き方にとどまっています。

3. 決めた幅が、結論を左右する

この試験が決めた幅は0.7ポイントでした。本文には「差の信頼区間の上限について、あらかじめ決めた非劣性の幅は0.7パーセントポイント」と書かれています。

大事なのは、この幅を広く取れば非劣性は出やすくなり、狭く取れば出にくくなるということです。結論の「非劣性だった」という言葉は、この0.7という線の置き方に丸ごと依存しています。

そして、ここは正直に書かなければなりません。この論文の本文には、0.7という数字を選んだ臨床的な根拠が書かれていません。 幅0.7が出てくるのは症例数の計算の説明のところで、「あらかじめ決めた非劣性の幅0.7パーセントポイント」と前提として置かれているだけです。設計の詳細は、別に公表されている設計論文と、雑誌のサイトに置かれた試験実施計画書を見るように書かれています。付録にも根拠はありません。つまり、読者はこの論文だけでは「なぜ0.7なのか」を確かめられません。

本文には参考になる記述が1つあります。考察の中で、2019年の大腸がん検診の診療ガイドラインの委員会が「15年で3%の絶対リスク」を、対応が必要な臨床的に意味のあるリスクの下限と考えていた、という引用が紹介されています。ただしこれは「99%以上の人が5年以内に大腸がんと診断されなかった」という結果を受けて、この患者を高リスクと分類することの議論につながるかもしれない、という文脈で出てくるものです。0.7ポイントという幅の根拠として書かれているわけではありません。

なお、症例数の計算のほうは試験の途中で見直されています。当初は「10年後の大腸がんの絶対リスク2%」を前提に、片方のグループに6852人(合わせて1万3704人)としていました。ところが試験開始後に出た観察研究の知見から、2019年に想定を1.4%に下げ、データ安全性モニタリング委員会と相談して、片方のグループに4826人(合わせて9652人)へ改めました。想定するリスクは下げましたが、幅0.7ポイントは変わっていません。1.4%というリスクに対する0.7ポイントは、相対的にはかなり大きな幅です(この読み方は本文には書かれていません。報告されている2つの数字を並べたものです)。

4. 上限0.68は、決めた幅0.7のすぐ下だった

結果です。差は −0.05ポイント、片側99.12%信頼区間の上限は0.68ポイントでした。決めた幅は0.7ポイント。0.68は0.7より小さいので、非劣性の条件を満たしたことになります。

その差は0.02ポイントです。著者自身が考察の最初の段落でこう書いています。「信頼区間の上限は非劣性の幅のすぐ下で、かろうじて非劣性の条件を満たした」。原文の言葉は narrowly(かろうじて)です。条件を満たしたと書いた同じ文の中に、著者自身がこの言葉を置いています。

言い方を変えると、もし決めた幅が0.6ポイントだったら、上限0.68はその外に出ます。決めた線の置き方が結論を左右するというのは、この意味です(0.68と0.6の比較は、報告された数字を並べた算術の話で、論文に書かれているものではありません)。

そして、この上限0.68が何を意味するかも押さえておきます。5年後から始めるやり方は、3年後から始めるやり方と比べて、5.5年時点の大腸がんが0.68ポイントまで多くなる可能性は否定できていない、ということです。0.68ポイントは、1万人あたり68人にあたります。決めた幅より大きくは悪くない、というのは、こういう幅を残したままの判断です。

論文が結論として書いているのは、「高リスク腺腫の患者では、ポリープ切除の5年後にサーベイランス内視鏡を始めることは、3年後に始めることに対して、5年時点の大腸がんの累積発生率について非劣性だった」というところまでです。考察では、この結果が経過観察の間隔の推奨の更新を「促すかもしれない(may encourage)」とも書いています。いっぽうで、この結果をだれにでも5年でよい、3年と5年は同じ、症状のない人が受ける一般の検診の間隔も5年でよい、という意味に広げることはできません。この3つは、本文のどこにも書かれていません。

結果を、幅で見る

ここからは数字を並べます。まず、非劣性の判定に関わる3つの解析です。どの解析でも、大腸がんと診断された人は同じ48人(5年のグループ25人、3年のグループ23人)です。 変わるのは、この48人の出来事から累積発生率を推定する方法です。検査に来なかった人をどう扱うか、年齢のデータが欠けていた人を含めるか、追跡をいつで打ち切るかが、解析ごとに違います。単純に分母を取り替えて割り直しているのではありません。

  • 本文が「主解析」と呼んでいる解析(逆確率重み付け):5年のグループ0.77%、3年のグループ0.82%。差 −0.05ポイント、片側99.12%信頼区間の上限0.68。決めた幅0.7のすぐ下です。対象は年齢の欠測13人を除いた1万786人です。
  • あらかじめ計画されていた解析(重み付けをしない ITT):5年のグループ0.48%、3年のグループ0.48%。差 0.00ポイント、上限0.383。この上限も0.7を下回っています。対象はランダム化された1万799人全員で、検査に来ず診断も死亡もなかった人は5.5年または離脱日で打ち切られます。小数第3位までの0.383は付録の Table S4 にあります。
  • 5年で打ち切った感度解析:5年のグループ0.68%、3年のグループ0.61%。差 +0.07ポイント、上限0.69。決めた幅0.7との差は0.01ポイントです。これは ITT の集団を使い、5年の検査に来なかった人を5年の時点で打ち切った解析です。追跡を切る時点が主解析とも ITT とも違います。

3つめについて、本文の書き方を見ておきます。本文は「5年で打ち切った intention-to-treat 集団での感度解析は、主解析と同様の結果を示した(showed results similar to those of the primary analysis)」と、1行で済ませています。その「同様」の中身は付録の Table S6 にしかありません。差の向きは主解析と逆で、5年のグループのほうが0.07ポイント多く、上限は0.69。3つの解析のうち、決めた線にいちばん近いのはこの解析です。

この3つを1つの帯の図にはしませんでした。理由は単純で、下限が報告されていないからです。片側の信頼区間なので、上限しかありません。下限を自分で埋めて帯を描けば、論文にない数字を描いたことになります。そのうえ「幅が0をまたぐかどうか」という、非劣性の判定とは別の枠を読者に押しつけてしまいます。ここで必要なのは、上限と0.7を見比べることです。ですから図にはせず、数字を箇条書きで並べました。

「主解析」と呼ばれているほうが、あとから足された解析だった

ここが、付録を読んで分かるいちばん大きなことです。

付録の「IPW Analysis Methods」の最初の一文は、こうです。「雑誌(the New England Journal of Medicine)から求められて、公表の前に、下記の計画外の追加解析(the additional unplanned analyses)を行った」。その「下記」が、逆確率重み付けの解析です。

いっぽう本文は、同じ解析を「主解析(the primary analysis)」と呼び、重み付けをしない ITT の解析を「あらかじめ計画された(prespecified/preplanned)」と呼んでいます。考察には「あらかじめ計画された、補正なしの ITT 解析は、逆確率重み付けによる主解析の結果を裏づけた」とあります。

整理すると、上限0.68という非劣性の判定を出しているのは、付録が「計画外」と書いているほうの解析です。ただし、あらかじめ計画されていた解析でも、差0.00、上限0.383で、この上限も0.7を下回っていました。非劣性を支持する結果が計画外の解析だけにある、ということではありません。どちらが正しいという話でもありません。欠測が3割から4割ある状況で、それを考慮した解析を求めた雑誌の判断にも理由があります。「主解析」は報告の上での位置づけ、「計画外」は事前の計画にあったかどうかの話なので、同じ解析に両方の呼び方が付くこと自体はおかしなことではありません。ただ、本文だけを読んでいると、上限0.68を出した解析があとから追加されたものだとは分かりません。付録まで開くと、本文と付録で同じ解析の呼び方が違っていることに気づきます。

同じような食い違いはもう1つあります。本文は「解析は R のバージョン4.5.1で行い、主評価項目の解析は R の survival パッケージで行った」と書いています。付録は「すべての解析は Stata で行った」と書いています。同じ解析についての記述が2か所で違うので、どの解析にどちらを使ったのかは、この2つの文書からは決められません。

がんは、どの検査で見つかったか

5.5年までに見つかった大腸がんは48人です。それがどの検査で見つかったかの内訳は、付録の Table S5 にあります。本文にあるのは、このうち予定外の内視鏡で見つかった人数(5年のグループは25人中9人、3年のグループは23人中5人)だけです。

  • 3年のグループ(23人):3年時点の検査で14人、5年時点の検査で3人、予定外の内視鏡で5人、診療記録から1人。
  • 5年のグループ(25人):3年時点の検査で0人、5年時点の検査で15人、予定外の内視鏡で9人、診療記録から1人。

5年のグループに3年時点の検査はないので、「3年時点の検査で見つかった人」は0人になります。ここは「3年目までにがんが出ていなかった」という意味ではありません。 5年のグループでは予定外の内視鏡で9人、診療記録から1人が見つかっていて、この10人がいつ診断されたかは、本文にも付録にも書かれていません。分かるのは「どの検査で見つかったか」だけです。

診断されたときの進み具合について、本文はこう書いています。早期(ステージ I か II)の大腸がんの発生も、進行(ステージ III か IV)の大腸がんの発生も、2つのグループで大きく違うようには見えなかった。著者はこれを「この試験の重要な所見」として考察の前のほうに置いています。「差がなかった」とは書かれていません。 Fig.3 に1000人あたりの人数として図示されていますが、その具体的な数値は本文にも付録にもありません。ですから、この記事でも人数は出しません。

死亡と、そのほかの評価項目

死亡についても、数字を確かめておきます。 大腸がんで亡くなったのは5人(5年のグループ3人、3年のグループ2人)です。著者は、事象の数が少ないため大腸がん死については推論のための統計(信頼区間や検定)を行っていないと明記しています。ですから、死亡について2つのグループに差があるとも、ないとも言えません。すべての原因による死亡は366人(3.55%)で、5年のグループ183人(3.60%)、3年のグループ183人(3.50%)でした。

副次的な評価項目は、重み付けの解析とあらかじめ計画された解析で数字が大きく変わります。混ぜて読まないために、両方を並べます。

  • 進行腺腫が見つかった人:重み付けでは5年のグループ11.07%、3年のグループ14.55%、差 −3.48ポイント(95%信頼区間 −4.98〜−1.96)。あらかじめ計画された解析では5年のグループ10.66%、3年のグループ10.82%、差 −0.16ポイント(−1.49〜1.17)。
  • どんな種類でも腺腫が見つかった人:重み付けでは54.82%と71.77%、差 −16.95ポイント(−19.02〜−14.86)。あらかじめ計画された解析では53.42%と61.49%、差 −8.07ポイント(−10.17〜−5.97。この数字は付録の Table S4 が初出です)。
  • 鋸歯状ポリープが見つかった人:重み付けでは25.95%と41.63%、差 −15.68ポイント(−17.89〜−13.41)。あらかじめ計画された解析では24.74%と33.17%、差 −8.43ポイント(−10.34〜−6.51。これも付録が初出です)。
  • 内視鏡に関連した有害事象(サーベイランスまたは予定外の内視鏡から30日以内の、輸血を要する出血、腸の穿孔、入院、死亡):重み付けでは0.63%と0.52%、差 0.11ポイント(−0.24〜0.47)。あらかじめ計画された解析では0.60%と0.38%、差 0.22ポイント(−0.10〜0.54)。

進行腺腫の差は、重み付けでは −3.48ポイント、あらかじめ計画された解析では −0.16ポイントです。ほぼ同じ集団の同じ評価項目でも、欠測の扱いなど解析方法の違いによって、推定される差が変わります。 どちらも、単に人数を数えた割合ではなく、仮定を置いた推定値です。ですから、どちらの数字かを言わずに「進行腺腫が3.5ポイント少なかった」と書くと、読み手には確かめようがありません。そして、これらの95%信頼区間は多重性の補正をしておらず、著者は「治療効果を推論するために区間の幅を使うべきではない」と書いています。

腺腫が3年のグループで多く見つかったことについて、著者の説明はこうです。1回の内視鏡より2回の内視鏡で多く見つかるのは、1回では見落としがあるためだろう。そのうえで、見つける数が多いことが患者の利益になるかは、まだ分からないと書いています(原文は remains to be seen)。

3〜4割は5年の検査に来ていない。その分を、どう埋めたか

ここは技術的な話ですが、この論文の主な数字がどこから来ているかに直結します。

100人のうち、5年後の検査に来たのは何人か

まず、この図が表しているものを確かめてください。色が付いた丸は、5年時点のサーベイランス内視鏡を予定どおり受けた人です。病気になった人ではありません。

5年のグループでは、100人のうち70人が受けました。報告されている割合は70.4%です。

3年のグループでは、100人のうち65人です。報告されている割合は64.6%です。3年のグループは3年時点にも検査があり、そちらは79.6%が受けています。

残りの30人と35人は、5年時点の検査を受けていません。この中には、5年より前に大腸がんと診断された人や亡くなった人も含まれます(実際の人数では、2つのグループあわせて388人)。この人たちは、重み1で結果の計算に入ります。

それ以外の、5年まで大腸がんの診断も死亡もなく検査に来なかった人については、まだ診断されていない大腸がんがあるかもしれないと著者は想定し、検査を受けた人の情報に重みを付けて補っています。主な数字(0.77%と0.82%)は、そうやって計算された推定値です。

5年後に検査を受けるグループ100人中 70人
3年後にも検査を受けるグループ100人中 65人

検査に来た人の割合の図です。病気の起こりやすさではありません。実際の割合は5年のグループ70.4%、3年のグループ64.6%で、図は著者が限界のところで書いている70%と65%に丸めた人数を置いています。 数字の見方を学ぶための図で、個人の予測ではありません。

論文のどこ:Results の Colonoscopies during Follow-Up の段落と、Discussion の限界の段落(Limitations of this trial include で始まる文)。来なかった人の内訳は Fig. 1

5年時点の検査を受けなかったのは3509人(5年のグループ1597人、3年のグループ1912人)です。付録の言い方では、3年のグループの35.4%、5年のグループの29.6%が予定の5年の検査に来ませんでした。理由の内訳は Fig.1 にあります。辞退(5年のグループ507人、3年のグループ583人)、窓の外で予定外の内視鏡を受けた(406人、403人)、施設の事務ミス(127人、273人)、同意の撤回(47人、130人)、一時的または永続的に医学的に不適、そのほか。そして5年より前に大腸がんと診断されたか亡くなった388人(188人、200人)は、そもそも5年の検査を受けられません。この図に記録された追跡不能は、5年時点で5年のグループ8人、3年のグループ6人(3年のグループの3年時点では10人)と、ごく少数です。

重み付けは、何をしているのか

手順は本文と付録に書かれています。

  1. ロジスティック回帰で、一人ひとりが5年時点の検査を受ける確率を推定します。ここでの対象は、5年より前に死亡しておらず、大腸がんと診断されていない人です。
  2. その確率の逆数に比例する「安定化した重み」を割り当てます。受けそうにない特徴を持っているのに受けた人は、重みが大きくなります。
  3. 5年より前に大腸がんと診断された人、亡くなった人には重み1を割り当てます。この人たちは、重みを推定するモデルには入りません。もともと5年の検査を受けられないからです。
  4. 累積発生率の計算に直接入るのは、5年時点の検査を受けた人と、いまの重み1の人たちです。5年まで大腸がんの診断も死亡もなく、検査に来なかった人は重み0で、計算には直接は入りません。ただし重みを推定するモデルには入っていて、受けた人の重みを通して間接的に反映されます。

前提は本文に明記されています。検査を受けなかった人のデータは、測った共変量で条件づければランダムに欠けている(missing at random)、という前提です。ここが崩れれば、結果は変わりえます。

重みのモデルに入っている変数と、入っていない変数

付録には、重みを計算するモデルの中身が載っています。重み全体に使われている情報は、次の6つです。

  • 年齢(と年齢の2乗。標準化も中心化もしていない)
  • 性別
  • BMI の区分(欠測も1つの区分として入れている)
  • 登録時の内視鏡の理由(その他・欠測も1区分)
  • 国(オーストリアとオランダを1つに、ポルトガルとスペインを1つにまとめている)
  • 割り付けのグループ

この6つは、2つのモデルに分かれて使われています。検査を受ける確率を推定する側(分母のモデル)には、上のうち割り付けのグループを除いた5つが入り、モデルは割り付けのグループごとに別々に当てられています。もう一方(分子のモデル)に入るのは、割り付けのグループだけです。

そして、入っていないものがあります。付録の変数の一覧に、ポリープの性質(大きさ、個数、組織型、異型度)、施設、喫煙、家族歴はありません。ここが「測っていない特徴で欠測が偏っていれば補正できない」という限界の、具体的な中身です。たとえば、大きなポリープを取られた人のほうが検査に来やすかったとしても、ポリープの性質はモデルに入っていないので、その偏りは補正されません。

なぜ重み付けが必要だったかは、付録の表を見ると分かる

付録には、5年の検査を受けた人と受けなかった人の登録時の特徴を比べた表があります(Table S3)。この表を読むときは、脚注に注意が必要です。「受けた人」の列には、5年の検査より前に大腸がんになった人や亡くなった人も入っています。 ですから以下の割合は、純粋に「受けた人」と「受けなかった人」の比較ではなく、表の受診扱いの列と非受診の列の比較として読みます。人数そのものも使いません。

年齢、性別、BMI はほとんど違いません。大きく違ったのは国と、登録時の内視鏡の理由の2つで、これは付録の本文にも「この2つに差が見られた」と書かれています。

  • 国:受診扱いの列ではポーランドが4.1%ですが、非受診の列では22.2%です。スペインは逆で、受診扱いの列の59.1%に対し、非受診の列では36.2%です。
  • 内視鏡の理由:最初から内視鏡で検診を受けた人は、受診扱いの列の8.4%に対し、非受診の列では23.6%。症状があった人は、受診扱いの列の22.7%に対し、非受診の列では14.4%です。

この表から言えるのは、2つの列のあいだで国と内視鏡の理由の構成が違っていた、ということです。「どういう人なら検査に来る」と一人ひとりについて言い当てられる表ではありません。

国ごとの偏りの大きさは、重みのモデルの推定値にも表れています。基準はデンマークで、いちばん大きな値が付いているのはポーランドです(3年のグループのオッズ比21.02、95%信頼区間 13.26〜33.31)。人数でも同じことが見えます。ポーランドでは、3年のグループの498人のうち、5年の検査に来たのが88人でした(5年のグループは501人のうち218人)。この88人の情報に重みを付けることで、来なかった人が多いことによる偏りを補います。

重みは「切り詰めたあと」の値しか載っていない

付録には重みの分布の表があり、全体で最小0.76、中央値0.91、最大1.77、平均0.98、標準偏差0.20です。1から大きく外れる重みは見当たりません。

ただし、これは切り詰めたあとの値です。付録にはこう書かれています。「EPoS II では、主評価項目について推定した重みを、これを超える極端な値があったため、98.5パーセンタイルで切り詰めた」。図の見出しにも「切り詰めたあと(after truncation)」と書かれています。切り詰める前の分布や最大値は、付録に載っていません。 切り詰めをしなかった場合の結果との比較もありません。

ですから、「極端な重みはなかった」とは書けません。書けるのは「極端な値があったので、上位1.5%を切り詰めている。切り詰めたあとの分布は1の近くに収まっている」までです。信頼区間はブートストラップ1000回で計算され、その各標本で重みも累積発生率も作り直されています。

なお、あらかじめ計画されていた解析(ITT)も、欠測について1つの仮定を置いています。検査に来ず、がんの診断も死亡もなかった人を「大腸がんではない」とみなす、という扱いです。こちらは発生率が低めに出ます(どちらのグループも0.48%)。どちらも仮定を置いていて、仮定の置き方で数字が変わります。3割から4割が来なかったという事実を、統計の技術で消すことはできません。

この研究では言えないこと

動画では、対象の限定を1つの限界として挙げました。ここでは、その中身を広げ、著者自身が書いている限界も分けて並べます。

主な限界は、誰を調べたかです

入ったのは、高リスク腺腫を取り切った40歳から74歳の人だけです。 高リスク腺腫は、10mm以上の腺腫、高度異型のある腺腫、絨毛状の成長、または3個から10個の腺腫のいずれかでした。付録の表から、登録時に取ったポリープの様子をいくつか見ることができます。ただし、集計の単位が2種類あるので、分けて読む必要があります。ポリープを単位とした集計では、平均の直径が5年のグループで7.00mm、3年のグループで7.04mm、組織型はおよそ7割が管状腺腫、高度異型はポリープの4.2%と4.5%でした。患者を単位とした集計では、登録時に3個以上のポリープを取られた人が58.1%と57.7%でした。この2つは別々の集計なので、「3個以上取られた人のポリープが小さかった」というような組み合わせは読み取れません。どの条件で何人が高リスクに分類されたかの内訳も、本文にも付録にもありません。

およそ3分の2は、便の検査(FIT)が陽性で内視鏡を受けた人です(65.2%と65.3%)。最初から内視鏡で検診を受けた人は12.8%、症状があった人は20.3%です。ですから、症状のない人だけを集めた研究でもありません。

症状のない人が受ける一般の検診の間隔の話ではありません。 低リスクの腺腫だった人(EPoS I)や、鋸歯状ポリープだけだった人(EPoS III)の話でもありません。その2つの研究の結果は、この論文には載っていません。

登録時の検査の質が前提になっています。 盲腸まで到達し、腸の洗浄がじゅうぶんで、見つかったポリープを全部取り切った検査です。著者はこれを試験の強みとして挙げています。強みであると同時に、この条件を満たさない検査には、そのまま当てはめられないということでもあります。

参加国は8つで、半分以上がスペインです。 日本は入っていません。日本の診療の推奨に当てはまるかは、この論文からは言えません。付録の代表性の表には、「患者は全員ヨーロッパ在住で、白人以外の割合はおそらく小さいと思われるが、この試験では人種・民族の情報を取っていない」と書かれています。著者自身が、取っていないことを認めています。

中間解析です

本来の主な評価項目は10年時点の大腸がんの累積発生率で、まだ出ていません。 今回は5.5年時点の中間解析です。著者は「10年の解析でさらに分かるかもしれない」と書いています。中間解析で試験を止める規則は設けていません(止めても患者に何の結果も生じないため、と説明されています)。

この中間解析については症例数の計算をしていません。 著者はこれを限界の2つ目に挙げ、そのために非常に保守的な99.12%信頼区間を使ったと書いています。

著者が挙げている限界は2つです

  1. 5年時点のサーベイランス内視鏡を予定どおり受けた人の割合が低いこと(本文の書き方では「5年のグループで70%、3年のグループで65%しか受けていない」)。受けなかった人の一部にはまだ診断されていない大腸がんがあるかもしれないと想定し、そのために主解析で逆確率重み付けを使ったと書かれています。
  2. 中間解析について症例数の計算をしていないこと。そのため非常に保守的な99.12%信頼区間を使ったと書かれています。

この記事で書いた、そのほかの限界

主な限界(誰を調べたか)に次いで大事だと考えたのは、最初に挙げる「非劣性」の読み方です。残りは、それぞれの説明に対応する注意点です。

  • 「非劣性」は「同じ」ではありません。 示されたのは「あらかじめ決めた幅0.7ポイントより大きくは悪くない」ということまでで、上限0.68は幅のすぐ下です。著者の言葉で「かろうじて」満たしました。幅0.7を選んだ臨床的な根拠は、本文にも付録にもありません。
  • 上限0.68を出した解析は、付録では「計画外の追加解析」と呼ばれています。 あらかじめ計画されていた解析でも上限は0.383で、0.7を下回っていました。本文が1行で「主解析と同様」とした感度解析は、差+0.07、上限0.69です。
  • 3割から4割が5年の検査に来ていません。 その分は統計の重み付けで補われています。重みに使われている情報は6つで、ポリープの性質、施設、喫煙、家族歴は入っていません。重みは98.5パーセンタイルで切り詰めたあとの値しか載っていません。
  • 見つかった時期は分かりません。 分かるのは「どの検査で見つかったか」だけです。予定外の内視鏡や診療記録から見つかった人(5年のグループ10人、3年のグループ6人)の診断時期は、本文にも付録にもありません。
  • 死亡については、差があるともないとも言えません。 大腸がんで亡くなったのは5人でした。事象が少ないため、著者は大腸がんで亡くなった人の数を2つのグループで比べる統計解析をしていません。
  • 副次的な評価項目の幅から、効果を読み取れません。 多重性の補正をしておらず、著者自身が区間の幅を治療効果の推論に使うべきではないと書いています。腺腫が多く見つかることが患者の利益になるかは「まだ分からない」とされています。
  • 費用対効果は計算されていません。 本文の背景に「長い間隔は費用対効果を改善し、患者の負担を減らすはずだ」という記述がありますが、この試験で計算したものではありません。
  • 同じ解析についての記述が、本文と付録で食い違っている箇所があります。 解析ソフトについて、本文は R のバージョン4.5.1、付録は「すべて Stata」と書いています。

最後に。この記事は、検査を受けないことや、間隔を延ばすことを勧めるものではありません。 この論文が示したのは、高リスク腺腫を取り切った人たちのあいだで、最初の経過観察の内視鏡を5年後に始めるやり方について、差の信頼区間の上限が、あらかじめ決めた0.7ポイントを下回った、という中間の結果までです。自分の検査の間隔は、主治医と相談してください。

元の論文の、どこを見ればよいか

読むときの手がかりを置いておきます。

  • 非劣性の幅と、症例数の計算:Methods の Statistical Analysis の最初の段落です。幅0.7パーセントポイント、当初は片方のグループに6852人としていたこと、2019年に4826人へ改めたこと、90%の検出力が書かれています。0.7を選んだ臨床的な根拠は、ここにも書かれていません。 設計論文(参考文献10)と、雑誌のサイトに置かれた試験実施計画書を見るように案内されています。
  • なぜ99.12%なのか:同じ Statistical Analysis の中ほどです。中間解析の症例数計算をしていないこと、第一種の過誤を中間解析と最終解析のあいだで抑えること、O'Brien–Fleming 型のアルファ消費関数、片側99.12%信頼区間、10年後は95.33%という予定が書かれています。ここでいう第一種の過誤が非劣性についての誤りであることは、同じ節の最初の段落(上限を0.7と比べる設計)と合わせて読むと分かります。
  • 重み付けの手順:同じ節の後半です。使う情報6つ、重み1と重み0の扱い、「測った共変量で条件づければランダムに欠けている」という前提が書かれています。くわしい説明は Supplementary Appendix の IPW Analysis Methods にあります。分母のモデルを割り付けのグループごとに当てるという記述も、そこにあります。
  • 主な数字:Table 2 です。大腸がんの患者数(48人、25人、23人)、重み付けの累積発生率(0.79%、0.77%、0.82%)、差と上限(−0.05(0.68))がいちばん上の段にあります。差の向きと、これが片側99.12%の上限であることは、この表の脚注に書かれています。累積発生率が単純な割合と一致しないことがある、という注意も同じ脚注です。Fig. 2 は累積発生の曲線で、重み付けの解析にもとづいています。
  • あらかじめ計画された解析(ITT)の数字:本文の Results の Incidence of Colorectal Cancer and Death の段落に0.48%と0.38が出てきます。表の形では Supplementary Appendix の Table S4 です(上限は0.383、腺腫と鋸歯状ポリープと有害事象の ITT はここが初出)。この解析が主解析の結果を裏づけたという記述は、Discussion の最初の段落の終わりにあります。
  • 5年で打ち切った感度解析:本文は「主解析と同様」の1行だけです。中身は Supplementary Appendix の Table S6(差0.07、上限0.69)にあります。表の見出しに「5年の検査に来なかった人を5年で打ち切った」と書かれています。
  • どの検査でがんが見つかったか:Supplementary Appendix の Table S5 です。本文にあるのは、予定外の内視鏡で見つかった9人と5人だけです。
  • 5年の検査を受けた人と受けなかった人の比較:Supplementary Appendix の Table S3 です。脚注を読んでください。 この表の「受けた人」の列には、5年の検査より前に大腸がんになった人や亡くなった人が含まれています。
  • 重みの中身:Supplementary Appendix の Table S7(分母のモデル。国ごとのオッズ比と、国ごとの来た人・来なかった人の人数)と Table S8(分子のモデル。割り付けのグループだけ)です。ここに出てくるオッズ比は、検査に来る・来ないを説明するモデルの値で、大腸がんのリスクを2つのグループで比べた値ではありません。重みの分布は Table S17 と Table S18、Figure S1 で、いずれも98.5パーセンタイル(腺腫と鋸歯状ポリープは99パーセンタイル)で切り詰めたあとの値です。切り詰めの記述は IPW Analysis Methods の中にあります。
  • 「計画外の追加解析」という記述:Supplementary Appendix の IPW Analysis Methods の Introduction、いちばん最初の一文です。
  • 取ったポリープの性質と、参加者の代表性:Supplementary Appendix の Table S1 と Table S2 です。Table S1 は、平均の直径がポリープを単位とした集計、ポリープの個数が患者を単位とした集計になっています。人種・民族の情報を取っていないという記述は Table S2 の中にあります。
  • 人の流れ:Fig. 1 です。除外の内訳、3年時点と5年時点の受診、受けなかった理由の内訳が入っています。5年より前に大腸がんと診断されたか亡くなった人の数も、ここにあります。
  • 「かろうじて条件を満たした」:Discussion のいちばん最初の段落です。narrowly meeting the criterion for noninferiority という言い方で書かれています。
  • 著者自身の限界:Discussion の終わりのほう、Limitations of this trial include で始まる文からです。強みを並べた文のすぐあとに来ます。
  • 結論の言い方:要旨の CONCLUSIONS と、Discussion のいちばん最後の段落です。どちらも among patients with high-risk adenomas という限定がついています。

元の論文はこちらです。Jover R ら. Colonoscopy Intervals and Colorectal Cancer Incidence after Adenoma Removal. N Engl J Med. 2026;395(11):1051-61. https://doi.org/10.1056/NEJMoa2603816

見方を練習するために

PR この記事は本の紹介を含みます。書名にリンクが付いているときは、広告(アフィリエイトのリンク)です。

この回で身につけたいのは、「非劣性」と書かれた結果を読むときの4つの手順です。1つめ、何と何を比べたのか。2つめ、悪くなる側の端はどこまで伸びているか。3つめ、許せる差の幅はいくつに決められていて、その根拠は書かれているか。4つめ、その端と幅の距離はどれくらいか。この4つを確かめると、「大きくは悪くない」という結果が「同じ」「もう延ばしてよい」に置き換わっていく道筋が見えるようになります。『統計でウソをつく法』は、同じ数字でも見せ方でどれだけ印象が変わるかを、身近な例で追える一冊です。

元の論文

Jover R ら. N Engl J Med. 2026.
https://doi.org/10.1056/NEJMoa2603816

もっと知りたい人へ

PRこの記事には広告(アフィリエイトのリンク)を含みます。

『統計でウソをつく法』