動画で話したこと
動画では、過敏性腸症候群の人に健康な人の便を移す治療を調べた、第3相のランダム化試験を紹介しました。ノルウェーの5つの病院で450人が参加し、くじ引きで2つのグループに分かれています。90日後に症状の点数が75点以上下がった人は、提供者の便を入れたグループで40%、自分の便を入れたグループで38%でした。差は1.9パーセントポイントで、推定のぶれを見込んだ範囲はマイナス8.1から12.0までです。腸内細菌そのものは提供者のものに寄って変わっていました。
短い動画で話せたのは、ここまでです。
この記事の芯は、数字の大きさではありません。「効果がなかった」という一言に、まったく違う三つの意味が入っている、ということです。
日本語だと、この三つがどれも「変わらなかった」で言えてしまいます。この台本を作るあいだ、同じ一文を三回書き直しました。書き直した理由そのものが、読者にとって役に立つと思うので、この記事ではそこを正面から扱います。
そのうえで、動画で言えなかったことを足します。誰をどう分けたのか。75点という基準はどこから来たのか。幅の上の端が何を意味するのか。そして、著者自身が書いている限界です。
先に断っておきます。この記事は、治療を受けるかどうかの判断について書いたものではありません。便を移す治療を勧めることも、やめるよう言うこともしません。この記事にあるのは、論文の本文に書かれていることと、その読み方だけです。
誰を、どう分けて、いつ測ったか
試験の形
この試験は、第3相の、並行群間の、ランダム化した、二重盲検の、偽の処置を対照とした試験です。研究者が自ら立ち上げた試験だと本文に書かれています。ノルウェーの5つの病院で、2021年5月から2023年10月まで行われました。参加できるかどうかの評価は、2021年5月5日から2022年7月14日にかけて行われました。本文がこの期間について数えているのは、適格性の評価を受けた2304人です。組み入れは、この期間の中で行われました。
論文は REFIT2 という名前を付けています。
参加できた人
18歳から65歳の男女で、中等度から重度の過敏性腸症候群がある人です。診断は Rome IV という国際的な基準で決め、さらに IBS-SSS という症状の点数が175点以上であることが求められました。
50歳以上の人は、参加の5年以内に大腸内視鏡を受けていることが必要でした。大腸がんを除くためです。下痢が主な型の人は、顕微鏡的大腸炎を除くために、生検が陰性であることが必要でした。
参加者は、SNS の広告、病院の組織、患者団体、公的な健康関連のウェブページ、かかりつけ医の診療所、ノルウェーのニュースメディアを通じて募集されました。参加を希望する人は、まず自分でウェブの質問票に答える必要がありました。ここは、あとの限界の話につながります。
除外された条件は、かなり多いです
本文には、除外条件が長く並んでいます。動画では尺の都合で落としましたが、この試験がどういう人たちの話なのかを決めているのは、ここです。
- 子宮内膜症、多嚢胞性卵巣症候群、糖尿病、肥満(BMI 35以上)
- 重い自己免疫の病気、または免疫不全
- 参加の妨げになる精神疾患、アルコールの乱用、薬物の乱用
- 過去に便微生物移植を受けたことがある
- 寝汗、原因の分からない体重減少、消化器のがんの濃い家族歴(50歳未満の第1度近親者が1人以上、または第1度・第2度の近親者が3人以上)
- 直腸からの浣腸ができない事情(骨盤底や括約筋の損傷など)
- 腸の動きに影響する薬の毎日の使用(症状が出たときに使う薬(ポリエチレングリコールやロペラミド)は認められた)
- プロトンポンプ阻害薬などの胃薬を週3日以上使っている
- 鎮痛薬の定期的な使用(非ステロイド性の抗炎症薬とパラセタモールは週3日までなら認められた)
- 12週以内に始めた抗うつ薬や抗不安薬、12週以内の抗菌薬、コレスチラミンの使用
- 消化器の検査が進行中、妊娠中や授乳中、妊娠の予定がある
- 大きな腹部手術の既往(虫垂切除、胆嚢摘出、帝王切開、子宮摘出は除く)、がんの既往(基底細胞がんは除く)
- 炎症性腸疾患、顕微鏡的大腸炎、憩室炎、イレウスの既往または現症
さらに、参加の前に身体診察と、血液検査(血球数、赤血球沈降速度、CRP、抗組織トランスグルタミナーゼ IgA、ラクターゼの遺伝子型)と、便の検査(潜血、便中カルプロテクチン、クロストリジオイデス・ディフィシルなどの病原体)を受け、すべての検査結果が陰性であることが求められました。
分け方は、2対1です
動画では「くじ引きで2つに分けました」とだけ言いました。実際の割り付けは、もう少し細かい形です。
参加者は、提供者A、提供者B、提供者C、偽の処置の4つに、2対2対2対3の割合で割り付けられました。9人分を1組とする固定したブロックを使い、過敏性腸症候群の型で層に分けたうえで割り付けています(混合型と分類不能型は同じ層にまとめられました)。
この2対2対2対3を、提供者の便を入れたグループと自分の便を入れたグループにまとめ直すと、全体では2対1になります。移植のほうが2倍多いのは、こういう理由です。
提供者ごとに割り付けたのは、著者の知るかぎり、過敏性腸症候群の試験としてはこの試験がはじめてだと本文に書かれています。提供者によって効き方が違うのかどうかを確かめるためです。
目隠しは、どうやって保ったか
ここが、この試験のいちばん手のこんだところです。
まず、参加者は全員、自分の便を出しました。そして、その便は全員分、移植に使える形に調製されました。移植のグループに当たる人も、そうでない人も、同じことをしています。
調製された検体は、各施設の専用の冷凍庫に入れられました。次に、この試験にまったく関わっていない独立した病院の職員が、コンピュータが作った割り付けの表に従って割り付けを行いました。
提供者の便を入れることになった人には、提供者の検体に本人の試験番号が貼られ、その人自身の便は、割り付けを行った職員が廃棄しました。自分の便を入れることになった人には、その人自身の検体に試験番号が貼られました。割り付けと番号貼りは、この独立した職員だけが行い、その職員は参加者の個人情報も臨床情報も見られない形になっています。
提供者の検体と、本人の便の検体は、見た目も扱いも同じで、担当者に渡されたときに区別がつかなかった、と本文にあります。研究者、参加者、治療を行う職員、診療にあたる職員、評価を行う職員のすべてが、試験の期間を通じて割り付けを知らされませんでした。
何を入れたか
提供者の便は、ノルウェー北部の大学病院にある便バンクから供給されました。提供者は3人で、男性2人と女性1人です。提供者の選び方は国際的な基準に沿っており、それに加えて市販の腸内細菌の検査も使われています。
1回分の中身は、新鮮な便60グラムを、生理食塩水120ミリリットルと85%グリセロール25ミリリットルに懸濁し、0.5ミリメートルのふるいで濾したものです。提供者が便を出してから1時間以内に、便バンクでマイナス80度に凍結されました。
自分の便を入れる側の検体も、まったく同じ手順で作られました。違うのは、材料が本人の便だという点だけです。
投与の前に、両方のグループとも腸の洗浄を受けました。ピコスルファートナトリウムとクエン酸マグネシウムという下剤です。投与の1時間前に検体を解凍し、決められた手順で準備します。投与は直腸からの浣腸で、そのあと腸の中に広げるために、あらかじめ検証された順序で体の向きを変えていきました。
抗菌薬による前処置はしていません。治療のあと、食事などの制限もありませんでした。
そして、この治療は1回だけです。くり返してはいません。
いつ測ったか
症状の評価は、治療のあと30日、90日、180日、365日の時点で行われました。
腸内細菌を調べるための便は、治療の2週間前と、治療から90日後に集められました。つまり、この記事で出てくる「菌が根づいた」という話は、90日後の1点での比較です。1年後の便は集められていないので、そのころまで根づいていたかどうかは、この論文からは分かりません。
割り付けどおりの比較か、実際に受けたかで分けた比較か
ここは読み分けが要ります。
本文は、主要評価項目と副次評価項目、そして安全性の評価に「修正 intention-to-treat 解析」を使ったと書いています。中身は、ランダムに割り付けられた人のうち、割り当てられた治療を実際に受けた人の全員です。
つまり、純粋な「割り付けどおりの比較」ではありません。割り当てられたのに治療を受けなかった人は入っていません。一方で、治療を受けたあとに気が変わった人や、うまくいかなかった人を後から外す形でもありません。
もう一つ。90日の評価が欠けた人は、治療が失敗したものとして数えられています。データがないから外す、という扱いではありません。これは、効果を大きく見せない方向に働く決め方です。ほかの評価項目では欠測が少なかったため、そろっている人だけで計算しています。
450人と、448人
ここに2人の差があります。
2304人が適格性の評価を受け、1357人がさらに詳しい評価に進み、最終的に450人が登録されて割り付けられました。内訳は、提供者の便を入れるグループに299人、自分の便を入れるグループに151人です。
ところが、割り付けたあとで、2人の参加者の治療が入れ替わってしまいました。この2人は、有効性の解析からも安全性の解析からも除かれています。残りの448人(298人と150人)が、解析に入っています。
動画で出した「298人中119人」「150人中57人」の分母は、割り付けの299人と151人ではなく、この298人と150人です。
2304人から、解析に残った448人まで
はじめに、2304人が適格性の評価を受けました。全員が、自分でウェブの質問票を出した人です。
質問票の答えによって947人が除かれ、1357人がさらに詳しい評価の対象になりました。1人が複数の理由で除かれることもあった、と図の注に書かれています。
そのうち907人が、電話がつながらなかった、詳しい評価で条件に合わなかった、あるいは募集が埋まっていて連絡されなかった、という理由で除かれました。残った450人が登録され、くじ引きで割り付けられました。提供者の便を入れるグループに299人、自分の便を入れるグループに151人です。
割り付けのあと、2人の治療が入れ替わってしまいました。この2人は有効性の解析からも安全性の解析からも除かれ、448人が解析に入っています。298人と150人です。脱落ではなく、割り当てと実際の治療が食い違ったための除外です。
| 適格性の評価を受けた人 | 2304人 |
|---|---|
| 質問票の答えで除かれず、さらに詳しい評価の対象になった人 | 1357人 |
| 登録されて、くじ引きで割り付けられた人 | 450人 |
| 解析に入った人 | 448人 |
人数だけを表した図です。効果の大きさを表すものではありません。最後の448人は、提供者の便を入れたグループ298人と、自分の便を入れたグループ150人の合計です。
論文のどこ:論文の Fig. 1(Trial profile)と、Results の最初の段落です
参加した448人のうち、女性は293人(65%)、男性は155人(35%)でした。年齢の中央値は36歳です(これは要旨に448人全体の値として書かれているものです。表1では、提供者の便を入れたグループが36歳、自分の便を入れたグループが35歳です)。型でいちばん多かったのは下痢が主な型で182人(41%)、次が混合型で173人(39%)でした。
ベースラインの IBS-SSS の中央値は、提供者の便を入れたグループで300点、自分の便を入れたグループで310点です。重症度の内訳は、重度が141人と79人、中等度が137人と65人、軽度が20人と6人でした。低 FODMAP 食を実践していると自分で答えた人は、それぞれ114人(38%)と58人(39%)です。
この数字は、何を指しているか
結果を見る前に、目盛りの話をします。ここを飛ばすと、数字を読み違えます。
IBS-SSS は、500点満点の自己記入の点数です
IBS-SSS は、5つの質問からなる自己記入式の質問票です。各質問が1点から100点で、合計は最大500点になります。点が高いほど症状が重いという向きです。
大事なのは、これが本人が答えた点数だということです。血液や画像の検査の値ではありません。著者自身も、自己申告の評価項目に頼っていることを限界として挙げています(あとで詳しく書きます)。
75点は、わざと厳しくした基準です
主要評価項目は、治療から90日後の時点で、IBS-SSS がベースラインから75点以上下がった人の割合です。
この75点という数字には、はっきりした理由が書かれています。本文の考察にこうあります。偽の処置への反応の出やすさを抑えるため、よく使われる50点以上という基準よりも厳しい75点以上を採った、と。
つまり、この試験は「良くなった」と数えるハードルを、ふつうより高く設定しています。それでも、両方のグループで4割前後の人がこのハードルを越えました。著者はこれを「この慎重なやり方にもかかわらず、両群で相当な反応率が続いた」と書いています。
500点満点の中の75点という幅がどれくらいの実感にあたるのかは、この論文には書かれていません。ここでは、点数の話として読んでください。
「1.9パーセントポイント」は、引き算です
40%と38%の差が1.9パーセントポイントです。
これは、40%の1.9倍という意味ではありません。40%が1.9%増えたという意味でもありません。割合どうしの引き算です。単位を「パーセント」ではなく「パーセントポイント」と書くのは、この区別のためです。
(119を298で割ると約39.9%、57を150で割ると38.0%になります。この引き算はこの記事でしたもので、これは論文が書いていることではありません。論文は1.9パーセントポイントという値を直接示しています。)
「95%信頼区間」は、推定のぶれ幅です
マイナス8.1から12.0までという範囲は、95%信頼区間と呼ばれるものです。
この幅は、同じような試験を何度もくり返したときに、推定した値がどれくらい散らばりうるかを表しています。「真の差が95%の確率でこの中にある」という言い方は正確ではありません。
この幅がゼロをまたいでいるとき、読めるのは「この試験のデータでは、差の向きを決められなかった」ということです。「差がない」と確かめた、ではありません。
差の指標と、倍率の指標
この論文は、同じ結果を2つのやり方で示しています。
1つはリスク差です。40%引く38%で1.9パーセントポイント。差がない位置は0です。こちらは調整をしていない、そのままの引き算です。
もう1つは調整後のリスク比です。90日の値は1.09で、幅は0.79から1.50までです。こちらは倍率なので、差がない位置は1になります。混合効果ポアソン回帰というモデルで、過敏性腸症候群の型とベースラインの点数を固定効果、提供者と施設を変量効果として計算されています。
論文は、オッズではなくリスクを報告した理由も書いています。リスクのほうが直感的に解釈でき、グループ間の絶対的な差をそのまま示せるからです。
同じ結果でも、目盛りが違えば差がない位置が変わります。下の図では、この2つを別々に描いています。
この試験が、見つけるつもりだった差の大きさ
ここが、この論文でいちばん読み落としやすいところです。
必要な人数を決めるとき、著者は、提供者の便を入れたグループで61%、自分の便を入れたグループで45%が反応すると見込みました。この差を、検出力0.90、有意水準0.05で見つけられる大きさとして、450人(移植300人、偽の処置150人)という人数が決まりました。
61%から45%を引くと16パーセントポイントになります。この引き算はこの記事でしたもので、論文の本文に16という数字が書かれているわけではありません。
つまり、この試験は16パーセントポイントの差を見つけるつもりで作られた試験です。それより小さな差は、あったとしても見逃しやすい設計になっています。
結果を、幅で見る
90日後に、75点以上下がった人
提供者の便を入れたグループは298人中119人で40%。自分の便を入れたグループは150人中57人で38%でした。
90日後に、症状の点数が75点以上下がった人(100人あたり)
左の100個の点が、提供者の便を入れたグループです。色が付いた点が、90日後に症状の点数が75点以上下がった人にあたります。100人のうち40人です。
右の100個の点が、自分の便を入れたグループです。色が付くのは100人のうち38人です。
ここで見てほしいのは、右側にも色が付いているということです。40人と38人という数字は、片方だけが良くなった形ではありません。どちらのグループでも、4割前後の人が75点以上の改善に届いています。
そして、40と38は同じ値ではありません。論文はこの2つを「同じだった」とは書いていません。書いているのは、この2つの差が1.9パーセントポイントで、その推定の幅が0をまたいだ、ということです。次の図で、その幅を見ます。
| 提供者の便を入れたグループ(298人) | 100人中 40人 |
|---|---|
| 自分の便を入れたグループ(150人) | 100人中 38人 |
論文の値は40%と38%です。この図は、それを100人あたりの人数に直して並べています。実際の人数は、提供者の便を入れたグループが298人中119人、自分の便を入れたグループが150人中57人です。90日の評価が欠けた人は、治療が失敗したものとして数えられています。75点は500点満点の点数の下がり幅で、よく使われる50点よりも厳しい基準です。この図は、どちらのグループでも4割前後の人がこの基準を越えたことを見せるためのものです。どちらのグループで多いかを比べる図ではありません。差とその幅は、次の図で見てください。 数字の見方を学ぶための図で、個人の予測ではありません。
論文のどこ:論文の Results の2段落目です。数値は Table 2 の1行目と Fig. 2 にもあります
差と、その幅
90日の主要評価項目の差は1.9パーセントポイントで、95%信頼区間はマイナス8.1から12.0まで、p 値は0.76でした。
論文は、ほかの副次評価項目についても同じ形で差を示しています。
このうち「十分な緩和」というのは、2つの条件を同時に満たしたことを指します。1つは、過去7日間の症状全体を7段階で尋ねる質問で1か2を付けたこと。もう1つは、過去7日間の腹痛が治療前より30%以上下がったことです。しかも、治療後69日から90日までの4つの時点のうち、2つ以上でこれを満たす必要がありました。欧州医薬品庁の基準に沿った定義だと本文に書かれています。
引き算で見た差(パーセントポイント)と、その幅
まず横の目盛りを見てください。縦に立っている線が0です。引き算の指標なので、ここが差のない位置になります。丸が推定値、横に伸びる棒がその幅です。
いちばん上が、あらかじめ一番の指標と決めていた項目です。丸は1.9のところ、棒はマイナス8.1から12.0まで伸びています。0をまたいでいます。
ここで、棒の右の端を見てください。12.0です。この試験は16パーセントポイントの差を見つけるつもりで作られました。12.0という上の端は、その16よりは小さいものの、けっして小さな数字ではありません。この試験のデータは、最大で12パーセントポイントほどの利益がある可能性を、まだ否定できていません。
左の端はマイナス8.1です。こちらの向きも同じだけ開いています。つまり、この幅が語っているのは「差の向きすら決められなかった」ということです。
2本目と3本目は、90日の別の指標です。生活の質が14点以上上がった人の差が2.8、症状と腹痛の両方で十分な緩和が得られた人の差が1.7。どちらも0をまたいでいます。
4本目は1年後の主要評価項目です。マイナス1.5で、向きが逆になっています。ここも0をまたいでいます。向きが逆になったことを「1年後には悪くなった」と読まないでください。幅はマイナス12.0から9.1までで、90日のときと同じく何も絞り込めていません。
5本目は1年後の生活の質です。推定値は7.0で、幅はマイナス2.6から16.6まで。幅の下の端がマイナス2.6で、この5本の中ではいちばん0に近いところまで来ています。それでも、またいでいます。そして、これは副次の評価項目です。主要評価項目で差が示されなかったあとに出てくる数字を、単独で取り出して読むことはできません。
| 90日 症状の点数が75点以上下がった人 | 1.9(-8.1 〜 12.0) |
|---|---|
| 90日 生活の質が14点以上上がった人 | 2.8(-6.6 〜 12.1) |
| 90日 十分な緩和が得られた人 | 1.7(-6.6 〜 9.9) |
| 365日 症状の点数が75点以上下がった人 | -1.5(-12.0 〜 9.1) |
| 365日 生活の質が14点以上上がった人 | 7.0(-2.6 〜 16.6) |
| 差がない位置 | 0 |
差がない位置は0です。表2の脚注には、0より大きいリスク差は、提供者の便を入れたグループのほうが良い結果になることを表す、と書かれています。したがって、マイナスは逆の向きになります(この読み替えはこの記事のもので、論文がそう書いているわけではありません)。どれも調整をしていない、そのままの引き算の差です。90日の主要評価項目の p 値は0.76でした。この図の部品は各行に「幅は0をまたいでいる/いない」と自動で表示しますが、これは目盛りとの位置関係を機械的に書いたものです。またいでいるという表示は「差がないと確かめた」という意味ではありません。
論文のどこ:論文の Results の2段落目と3段落目です。365日の値は「At 365 days after treatment」で始まる段落にあります。数値は Table 2 にもまとまっています。90日と365日の主要評価項目は Fig. 2 にも描かれています
倍率で見ると
同じ結果を、調整後のリスク比でも見ておきます。
倍率で見た結果(調整後のリスク比)と、その幅
縦に立っている線が1です。ここが差のない位置になります。上の図の線は0でした。同じ結果でも、目盛りが変われば差のない位置が変わります。
上の行が90日で、1.09。幅は0.79から1.50までです。1をまたいでいます。
1.09という数字を「9%多かった」と読まないでください。幅の下の端は0.79で、上の端は1.50です。0.79は2割ほど少ない向き、1.50は5割ほど多い向きにあたります。推定はこの範囲の中で定まっていません。
下の行が365日で、0.98。幅は0.71から1.36までです。ここも1をまたいでいます。
上の図の1.9パーセントポイントと、この1.09は、同じ90日の同じ人たちの結果です。片方が引き算、もう片方が倍率というだけの違いです。ニュースの見出しがどちらを使っているかで、受ける印象は変わります。
| 90日 症状の点数が75点以上下がった人 | 1.09(0.79 〜 1.5) |
|---|---|
| 365日 症状の点数が75点以上下がった人 | 0.98(0.71 〜 1.36) |
| 差がない位置 | 1 |
差がない位置は1です。倍率の指標なので、0ではなく1に線が引かれています。1より大きいと、提供者の便を入れたグループのほうで75点以上の改善が多い向き、1より小さいとその逆の向きになります(表2の脚注にそう書かれています)。この値は、過敏性腸症候群の型とベースラインの点数を固定効果、提供者と施設を変量効果とした混合効果ポアソン回帰から出たものです。上の図の引き算の差とは、調整の有無も目盛りも違うので、直接くらべられません。この図の部品は各行に「幅は1をまたいでいる/いない」と自動で表示しますが、これは目盛りとの位置関係を機械的に書いたものです。
論文のどこ:論文の Results の2段落目と3段落目です。365日の値は「At 365 days after treatment」で始まる段落にあります。数値は Table 2 の「Risk ratio」の列にもあります
部分集団と、感度分析
論文は、いくつかの切り口で分け直した解析も報告しています。性別、過敏性腸症候群の型、ベースラインの重症度、低 FODMAP 食を実践しているかどうか、浣腸の保持時間、気分の障害、疲労、身体化の傾向、子ども時代の逆境。どれでも、治療効果の違いは見られなかったと書かれています。
提供者ごとの比較も、あらかじめ決めていた比較でも、あとから行った比較でも、違いは見られませんでした。
基準を50点や100点に変えた感度分析でも、結果は変わりませんでした。また、登録からベースラインの記録までに時間が空いたために、記録の時点では軽症(175点以下)になっていた人が、提供者の便を入れたグループに20人(7%)、自分の便を入れたグループに6人(4%)いました。この人たちを除いた感度分析でも、結果は変わっていません。
「効果がなかった」には、三つの意味があります
ここが、この記事の芯です。
「効果がなかった」「変わらなかった」という一言は、日本語だと次の三つのどれにでも使えてしまいます。そして、この論文で正しいのは、三つ目だけです。
一つ目:誰も良くならなかった
これは誤りです。
両方のグループで、4割前後の人が75点以上の改善に届いています。298人中119人、150人中57人です。これは、さきほどの点の図で見たとおりです。
さらに、この75点という基準は、よく使われる50点よりも厳しく設定されたものでした。ハードルを上げたうえで、それでも4割前後が越えています。著者は考察で、この慎重なやり方にもかかわらず、両群で相当な反応率が続いた、と書いています。
この試験は、過敏性腸症候群が良くならない病気だと示したものではありません。良くなった人は、どちらのグループにもいました。
二つ目:二つのグループで同じだった
これも誤りです。
40%と38%は、同じ値ではありません。119人と57人という実際の人数から計算された、別々の数字です。
論文は、この二つを「同じだった」とは一度も書いていません。書いているのは、この二つの差が1.9パーセントポイントで、その推定の幅がマイナス8.1から12.0までだった、ということです。
「p 値が0.76だったから同じ」という読み方も、できません。p 値が大きいことは、「差がないと確かめた」ことではありません。
三つ目:二つのグループの差は、示されなかった
これが正しい言い方です。
差は1.9パーセントポイント、幅はマイナス8.1から12.0まで。この幅は0をまたいでいるので、差の向きすら決められていません。
著者自身の書き方も、そうなっています。要旨の解釈の欄は「この試験は、過敏性腸症候群の患者における便微生物移植の臨床的な利益を示さなかった」です。結論の段落も「この第3相試験は、中等度または重度の過敏性腸症候群の患者を治療するうえでの便微生物移植の臨床的な利益を示さなかった」です。
「効果がないことを証明した」とは、どちらにも書かれていません。
ただし、公平を期すために、著者のもう一つの書き方も並べておきます。考察の冒頭には「治療効果は、すべての主要および副次の臨床評価項目にわたって存在しなかった」とあります。ここは、要旨の書き方よりも一歩踏み込んだ言い方です。この食い違いについては、あとの節でもう一度触れます。
なぜ、この区別にこだわるのか
幅の上の端が12.0だからです。
この試験は、16パーセントポイントの差を見つけるつもりで450人という人数を決めました。実際に得られた幅の上の端は12.0です。この試験のデータは、12パーセントポイントほどまでの利益を否定できていません。
「差がなかった」という見出しを見たら、差の幅の上の端を探してください。そこに何が書いてあるかで、その研究が何を言えたのかが決まります。上の端が1に近いのか、12なのか、40なのか。同じ「有意差なし」でも、意味はまったく違います。
腸内細菌は、実際に動いていました
この試験で目を引くのは、菌のほうは実際に動いていた、という点です。症状の改善の差が示されなかったのとは別に、腸内細菌の組み合わせは変わっていました。
ベースラインでは
治療の前の時点では、二つのグループのあいだに、菌の相対的な量にもアルファ多様性にも違いはありませんでした。ただし、どちらのグループも、提供者とははっきり違っていました。
90日後には
提供者の便を入れた人たちでは、菌の相対的な量がベースラインから有意に変化していました。そして、菌の相対的な量もアルファ多様性も、二つのグループのあいだで有意に違っていました。
さらに本文は、こう書いています。3つの提供者のグループすべてで、割り当てられた提供者の菌の組み合わせに向かう、一貫した方向の変化が見られた。90日後とベースラインの比較で、調整後の p 値はすべての比較で0.0001未満だった。しかも、割り当てられていない提供者よりも、割り当てられた提供者のほうに強く近づいていた、と。
これが「定着」と呼ばれているものです。
一方、自分の便を入れた人たちでは、どの提供者の菌の組み合わせにも近づいた証拠はありませんでした。提供者Aへの調整後 p 値が0.32、Bが0.36、Cが0.32です。
ここで混ぜてはいけない数字があります
本文には、提供者Bについて「有意でなかった」と書かれた箇所があります。ベータ多様性が、ベースラインから90日後にどれだけ変化したかを見た解析です。提供者Aは R²が0.104で調整後 p=0.001、提供者Cは R²が0.070で p=0.001。提供者Bだけが R²が0.008で p=0.20でした。
これは、定着の解析とは別の解析です。
同じ段落の続きに、提供者の便を入れた人たち全員が、自分の便を入れたグループと比べて90日後のベータ多様性に有意な変化を示した、と書かれています。提供者Bも、効果は小さいながら有意でした(R²が0.007で p<0.001)。
そして、割り当てられた提供者に向かう方向の変化、つまり定着の解析では、3つのグループとも調整後 p 値が0.0001未満です。
「提供者Bでは菌が根づかなかった」とは読めません。読み違えやすいところなので、分けて書いておきます。
著者の解釈
著者は、投与の方法が悪かったせいで効果が出なかった、という説明を採っていません。
本文はこう書いています。私たちの投与方法は、3つの受け手のグループすべてで、統計的に有意な方向性のある定着をもたらした。このことは、臨床的な利益がなかったことを、菌の移し方や定着の不十分さのせいにするのは考えにくいことを示している、と。
そのうえで、投与の経路が定着以外の形で体の免疫の反応に影響する可能性には触れています。上部の消化管から入れると、免疫の働きが活発な小腸が大腸の菌にさらされるのに対し、浣腸や内視鏡で入れる場合は、提供された材料がもともとの住処に直接置かれる、という説明です。
安全性について、表に書かれていること
この節は、数え方の話です。治療の安全性についての判断は、この記事ではしません。
何件で、何人か
本文には、365日までに、提供者の便を入れたグループで有害事象が24件あり、そのうち6件が重い有害事象だった、とあります。自分の便を入れたグループでは8件で、重いものはありませんでした。
表では、有害事象が1件あった人が16人(5%)対6人(4%)、2件あった人が4人(1%)対1人(1%未満)と分かれています。足すと20人と7人です(この足し算はこの記事でしたもので、これは論文が書いていることではありません)。表の脚注に、3件以上あった人はいないと書かれています。
表の行には「Serious adverse events」が6(2%)対0と並んでいます。この6が数えているのが出来事の件数なのか、人数なのかは、材料が両側にあります。結果の節は、24件の有害事象の内数として6を挙げています。一方、表の行は298人を分母にした割合(2%)として示されており、脚注に挙げられている患者は5人です。その5人のうち1人が、2つの出来事を経験したように読めます。6を298で割ると2.0%、5を298で割ると1.7%で、どちらも表記上は2%に丸まります(この割り算はこの記事でしたもので、これは論文が書いていることではありません)。この記事では、表の6を人数として数え直すことはしません。
表に入っていない6件があります
表の脚注に、もう一つ大事なことが書かれています。治療の前に記録された6件の有害事象(提供者の便を入れる側に5件、自分の便を入れる側に1件)は、この表に含めていない、と。
つまり、20人と7人という数字は、治療のあとに起きたものを数えたものです。試験の期間中に何かが起きた人の総数ではありません。
「重い」の定義
有害事象が「重い」と分類されるのは、死亡、または重篤な健康の悪化につながった場合です。重篤な健康の悪化は、次の三つと定義されています。
- 生命を脅かす病気またはけが
- 身体の構造や機能の永続的な障害
- 新たな入院、または入院の延長
「重い」というのは、この定義に当てはまったかどうかの分類です。治療が原因だという意味ではありません。
中身
表の脚注に挙げられているのは、次の5人です。憩室炎が1人、治療の3週間後の胆嚢炎が1人、もともとあった精神疾患の治療を強める必要があった人が1人、指の裂傷が1人、そして急性虫垂炎が1人です。最後の人は、移植の翌日に症状が出て、その2か月後に卵管水腫を起こしています。
治療との関係
表には、治療との関係の分類も載っています。提供者の便を入れたグループでは、関係がないが6件、おそらく関係がないが14件、関係がある可能性があるが2件、おそらく関係があるが2件で、確実に関係があるは0件です。自分の便を入れたグループでは、関係がないが2件、おそらく関係がないが3件、関係がある可能性があるが1件、おそらく関係があるが2件で、こちらも確実に関係があるは0件です。
本文には、おそらく関係がある、または関係がある可能性がある有害事象があったのは、提供者の便を入れたグループで4人、自分の便を入れたグループで3人で、いずれも重いものではなかった、とあります。追跡の期間中に亡くなった参加者はいませんでした。
著者の書き方
要旨には、有害事象があった参加者の割合が、二つのグループで同程度だったと書かれています。要旨のこの文に、重い有害事象は出てきません。
Research in context では、有害事象と重い有害事象の両方について、参加者の割合が二つのグループで同程度だったと書かれています。
一方、表の行では、重い有害事象は6(2%)対0です。重い有害事象まで含めて「同程度」と書いているのは、要旨ではなく Research in context のほうだ、ということになります。
この記事では、表の数字と著者の書き方の両方を並べました。片方だけを出すと、読む人の受け取り方が偏るためです。
本文の中で、そろっていないところ
論文を読むときに、著者を疑う必要はありません。ただ、同じ論文の中で書き方がそろっていない箇所があると、そこが読み違えの入口になります。この論文には3か所あります。
1. 「すべての評価項目で効果がなかった」と、繰り返し測定の2つ
考察の冒頭に「治療効果は、すべての主要および副次の臨床評価項目にわたって存在しなかった」とあります。
一方、結果の節には、こう書かれています。IBS-SSS の繰り返し測定(ベースライン、90日、180日、365日)の解析では、時間を通じた平均の治療差に違いは見られなかった。しかし、繰り返し測定の解析では、生活の質の点数の上昇(平均の点数の差3.65、95%信頼区間 1.39〜5.91)と、気分の障害がある人の割合の低下(リスク比0.83、95%信頼区間 0.69〜0.99)が示された、と。
この2つは、幅が差のない位置をまたいでいません。生活の質は0を、気分の障害は1をまたいでいません。
この2つと、考察の「すべての評価項目にわたって存在しなかった」という文は、本文の中でそろっていません。
この記事では、この2つを図にしていません。理由は2つあります。1つは、著者自身がこれを治療の効果として扱っていないこと。もう1つは、主要評価項目で差が示されなかったあとに出てくる多数の副次的な数値の中から、幅がまたがなかったものだけを取り出して大きく見せると、実際より強い結論に見えてしまうことです。とくに気分の障害のリスク比の上の端は0.99で、境界のすぐ内側にあります。
ここで読み取れるのは、「この論文の中に、書き方がそろっていない箇所がある」というところまでです。
2. 「23%から56%」が、2か所で違うものを指しています
結果の節には、施設ごとに見ると、3か月の治療成功が23%から56%の範囲だった、とあります。ここでいう治療成功は、二つのグループを分けずにまとめたものと読めます。
ところが考察には、偽の処置への反応が施設によって大きくばらつき、3か月では23%から56%、12か月では33%から59%だった、と書かれています。
同じ数字が、片方では両方のグループを合わせた成功率、もう片方では自分の便を入れたグループの反応として出てきます。どちらが正しいのかは、本文だけでは決められません(施設ごとの数値そのものは、付録にあります)。
この記事では、この数字を結論に使いません。
3. 「半分近く」という言い方
考察の同じ段落に「自分の便を入れたグループの参加者の半分近くが臨床的な改善に達した」とあります。
本文に書かれている実際の数字は、90日で38%、365日で45%です。90日の38%を「半分近く」と呼ぶのは、少し広い言い方です。
この記事では、38%と45%という数字のほうを使います。
この研究では言えないこと
測ったのは、本人が答えた点数です
主要評価項目も、主な副次評価項目も、本人が質問票に答えて付けた点数です。血液や画像や内視鏡の所見ではありません。
著者自身が、これを限界として挙げています。本文は、自己申告の評価項目に頼ることは過敏性腸症候群の試験に共通する限界であり、臨床的な効果を評価するための客観的な指標がほとんどないためだ、と書いています。
さらに、症状の聞き方についても限界を挙げています。毎日の日記ではなく、週ごとに振り返る形で聞いたので、思い出しの偏りが起きうる、と。ただし、もしそういう偏りが起きたとしても、二重盲検なので両方のグループに同じように起きるはずだ、とも書いています。
参加できたのは、応募した人の19%です
著者はこう書いています。試験に参加する可能性のある人は、自分からウェブの適格性の質問票を出す必要があった。参加を希望した人のうち、試験に入れたのは19%だけで、これは自己選択の偏りにつながり、たとえば結果の一般化可能性に影響しうる、と。
ここには、著者自身の反論が続きます。動画では尺の都合で片側しか言えなかったので、両方を書いておきます。
著者は、こう続けています。ただし、適格性の質問票は公開されていて、よく宣伝されていた。もともと参加を申し込んだ人の多くは、過敏性腸症候群の基準を満たさなかったか、募集が埋まっていたために連絡されなかった。さらに、参加者のベースラインの特徴、つまり性別と症状の型の分布は、既知の過敏性腸症候群の疫学と一致していた。全体として、試験の参加者は本当の過敏性腸症候群の集団を代表していたと考える、と。
19%という数字を「特殊な人ばかり集めた試験だ」と読むことも、著者の反論を「だから代表性に問題はない」と読むことも、どちらも行きすぎです。読めるのは、著者が限界として挙げたうえで、その理由を説明している、というところまでです。
除外条件が、対象を決めています
さきほど並べた除外条件の一覧も、この試験が誰の話なのかを決めています。糖尿病のある人、BMI が35以上の人、抗うつ薬や抗不安薬を12週以内に始めた人、鎮痛薬を定期的に使っている人、炎症性腸疾患の既往がある人などは、この試験に入っていません。
著者もこう書いています。厳しい適格条件によって、ほかの病気を除くことで診断のばらつきは最小限にできたが、過敏性腸症候群そのものが持つ生物学的・病態生理的なばらつきには、必ずしも対処できていない、と。
調べたのは、1回だけの浣腸という、1つのやり方です
この試験で行われたのは、健康な提供者の便60グラムを準備して、1回だけ、直腸から浣腸で入れる、というやり方です。
くり返し入れたらどうか。口から入れたらどうか。別の提供者ならどうか。この論文は答えていません。提供者については3人を比べていて、そこには違いが見られませんでした。
著者は、この試験で浣腸を選んだ理由も書いています。内視鏡を使う方法にくらべて、簡単で、費用が安く、体への負担が少ないからです。
この論文は、サプリも発酵食品も調べていません
これは、はっきり書いておく必要があります。
この論文が調べたのは、健康な提供者の便を移す治療だけです。プロバイオティクス、ヨーグルト、発酵食品、食物繊維、サプリメントについては、本文のどこにも記述がありません。この論文は、それらについて何も言っていません。良いとも悪いとも言っていません。
参加者の食事の中身について本文が記録しているのは、低 FODMAP 食だけです。それも、ベースラインで本人が実践していると答えたかどうか(それぞれ38%と39%)と、それで分けた部分集団の解析(違いは見られなかった)、そして限界の記述(参加者の食事について、ベースラインの低 FODMAP 食の自己申告を超える情報がない)の3か所だけです。
著者が「効かないだろう」と書いている範囲も、限定されています。本文の言い方は「狙いを定めない菌叢の置き換え」という戦略についてです。同じ文の前半で、著者は、腸内細菌が過敏性腸症候群の成り立ちに関わっている可能性は残る、とも書いています。
便を移す治療そのものを、否定した論文ではありません
Research in context の欄に「REFIT2 試験の結果は、過敏性腸症候群の患者における便微生物移植の使用を支持しなかった」という文があります。
この文は、過敏性腸症候群の患者における使用に限った言い方です。便を移す治療そのものへの評価ではありません。
同じ論文の前置きには、こう書かれています。この処置は、クロストリジオイデス・ディフィシル感染をくり返す患者にとっては確立した治療だが、ほかの病気での有効性は不確かである、と。
この論文が調べたのは、過敏性腸症候群だけです。ほかの病気での効き方は、この試験の対象ではありません。
著者が挙げた、そのほかの限界
- 細菌の機能の解析がないこと。この試験が見たのは、どの菌がどれだけいるか、という組み合わせの変化です。その菌が何をしているか(機能)は調べていません。著者は考察で、提供者の菌の組み合わせよりも、分類を超えた菌の機能のほうが、治療の反応を決める要因として重要かもしれない、と書いています。
- 参加者の食事の情報が、ベースラインの低 FODMAP 食の自己申告しかないこと。
資金と、利益相反
この試験の資金は KLINBEFORSK(課題番号2019209)です。本文には、資金提供者は研究の設計、データの収集、解析、解釈、報告の執筆のいずれにも関与していない、と書かれています。
もう一つ、謝辞に書かれていることがあります。製薬企業の Ferring Pharmaceuticals が、腸の洗浄剤である Picoprep を無償で提供しました。この下剤は、両方のグループが投与の前に使ったものです。
著者の利益相反の申告もあります。1人が2024年に製薬企業が主催した学術集会で便微生物移植について無報酬で講演したこと、1人が2025年にある企業から講演料を受け、別の企業から学会に参加するための資金を受けたこと、1人が他の試験のデータ監視・倫理委員会の委員および委員長であること、1人が学会への旅費の個人補助を受けたことが挙げられています。そのほかの著者は、利益相反はないと申告しています。
この記事は、これらが結果を歪めたと言っているのではありません。論文にそう書かれているので、そのまま書いています。
元の論文のどこを見ればよいか
元の論文は、次のとおりです。
Johnsen PH ら. Faecal microbiota transplantation in irritable bowel syndrome (REFIT2): a randomised, double-blind, placebo-controlled, phase 3 trial. Lancet. 2026.
DOI のリンクはこちらです。https://doi.org/10.1016/S0140-6736(26)01424-8
臨床試験の登録番号は NCT04691544 です。
この記事で扱ったことが、論文のどこにあるかを並べておきます。
- 誰が入って、誰が残ったか:Fig. 1(Trial profile)と、Results の最初の段落
- 除外条件の一覧:Methods の Participants の節
- 2対2対2対3の割り付けと、盲検の保ち方:Methods の Randomisation and masking の節
- 何を、どうやって入れたか:Methods の Procedures の節
- IBS-SSS が500点満点であること:Methods の Procedures の節の後半
- 主要評価項目と副次評価項目の定義:Methods の Outcomes の節
- 450人という人数の根拠(61%と45%):Methods の Statistical analysis の節の最初の段落
- 修正 intention-to-treat と、欠測を治療失敗とした扱い:同じ節の2段落目
- 40%と38%、差1.9、幅マイナス8.1〜12.0:Results の2段落目。数値は Table 2 の1行目と Fig. 2 にもあります
- 1年後の44%と45%:Results の「At 365 days after treatment」で始まる3段落目と、Table 2、Fig. 2
- 繰り返し測定の3.65と0.83:Results の「Median IBS-SSS scores were similar over time」で始まる段落
- 有害事象:Results の有害事象の段落と Table 3。重い有害事象の定義と5人の中身は、Table 3 の脚注
- 菌の定着:Results の細菌についての段落の後半
- 75点という基準を選んだ理由と、偽の処置への反応:Discussion の「Nearly half of the participants in the placebo group」で始まる段落
- 限界:Discussion の「The strengths of the current trial」で始まる段落から、最後の段落まで
- 著者の結論:要旨の Interpretation の欄と、Discussion の最後の段落
- 「使用を支持しなかった」という記述:Research in context の「Implications of all the available evidence」の欄
- 資金と Picoprep の無償提供:Acknowledgments
見方を練習するために
この回の芯は、「差が出なかった」と「差がない」は別のことだ、という一点です。
40%と38%。この二つが並んでいるとき、同じだと言いたくなります。p 値が0.76と書いてあれば、なおさらです。でも、論文が示しているのは、この試験のデータと矛盾しない差がマイナス8.1から12.0までの範囲にひろがっている、というところまででした。上の端の12.0を見ずに「差がなかった」と読むと、この試験が言えたことより強い結論になります。
この読み方は、統計の入口にあたる部分です。平均、ばらつき、検定。この三つを順にたどると、「有意差なし」が何を言っていて何を言っていないのかが、自分で説明できるようになります。
そこに一番近い入門書として、『統計学がわかる』(向後千春、技術評論社)を挙げておきます。数式を追う前に、なぜばらつきを見る必要があるのかから始まる本です。この記事のページでは、この書名にアフィリエイトのリンクを付けています。
最後に、もう一度書いておきます。この記事は、便を移す治療を勧めるものでも、やめるよう言うものでもありません。治療についての判断は、この記事の外にあります。ここで扱ったのは、一つの数字と、その幅の読み方だけです。
元の論文
Johnsen PH ら. Lancet. 2026.
https://doi.org/10.1016/S0140-6736(26)01424-8
もっと知りたい人へ
PRこの記事には広告(アフィリエイトのリンク)を含みます。