Proposal / Phase 2 説明書

論文の手法を、
Colab と AI でどこまで体験できるか ── あびこさんの文献9本を土台にした、Phase 2 からの進め方の提案

0 / まず確認

あびこさんが本当にやりたいこと

ヒルシュスプルング病の根治術で、術中迅速病理のHE染色凍結切片から神経節細胞を検出・カウントし、密度や分布を定量化して断端スコアを出す。

SOURCE: ヒルシュAI.pptx(研究相談スライド)

正直にお伝えします。この3ヶ月では、それ自体は作りません

1

スライド全体(WSI)を扱う仕組みが必要

2

術中凍結切片という、通常の標本とは別の難しさがある

3

「正解」を専門家が一枚一枚つける、ラベル付けの工数が大きい

4

相応の計算資源が要る

5

倫理審査を通す必要がある

どれも週1回60分×数回に収まる規模ではありません。代わりに目指すのは、専門家に依頼するときの解像度を上げること。卒業時に、自分の研究について「何を入れて何を出すか/正解を誰がどう作るか/何症例あるか/何をもって成功とするか/術中という時間制約」を1枚で書ける=紹介状(依頼仕様書)が書ける状態にします。

進め方の骨組み:AIエージェントに依頼しながら進む

毎回、あびこさんが「こういうものが欲しい」とAIエージェント(Claude Code)に言葉で伝え、エージェントがコードを書き、あびこさんが動きを見て判断します。コードを手で書く場面はありません。これは「専門家に依頼する練習」そのものです。

1 / 道具の説明

Google Colab とは何か

一言でいうと、Google が無料で貸してくれる「ブラウザの中の実験用パソコン」です。自分のパソコンには何も入れず、Google アカウントでページを開くだけで、機械学習のコードを動かせます。

たとえるなら
共用の検査室を、時間貸しで借りる

自分の医局に高価な機器を置かなくても、予約なしで使える共用ラボ。使い終わったら片付けられるので、自分のパソコンは汚れません。

画面の見た目
「ノートブック」=説明・オーダー・結果が1枚に並ぶ実験ノート

文章のマス、コードのマス、結果(表・グラフ・画像)のマスが上から順に並びます。カルテの「所見 → オーダー → 結果」に近い並びです。

できること
Python が動く/GPU が借りられる/Drive の画像が読める

GPU は「学習を何十倍も速くする計算機」。無料枠でも借りられます。Google Drive に置いた画像フォルダをそのまま読み込めます。結果はその場で表示されます。

できないこと・注意
時間制限がある/消える/患者データは置かない

無料枠は連続使用に上限があり、混んでいると GPU が借りられないこともあります。しばらく放置すると作業中のものは消えるので、結果は Drive に保存します。患者の実データは絶対に置きません(公開・匿名の練習用データだけを使います)。

Phase 2 での使い方:エージェントが書き、あびこさんが回す

hirschsprung_practice.ipynb ─ Google Colab(イメージ)
文章
エージェントが書く
このノートブックは、Drive の 練習用画像/ を読み込み、学習済みモデルを転移学習して、混同行列を表示します。上から順に ▶ を押してください。
▶
エージェントが書く from ultralytics import YOLO model = YOLO("yolo_pretrained.pt") model.train(data="drive/練習用画像/data.yaml", epochs=20)
結果
あびこさんが読む
学習 3分12秒 / 検出できた割合 0.87 / 混同行列(画像)/ 枠を描いた検証画像 8枚
→ この結果をエージェントに見せて「なぜ間違えた画像があるのか」「患者単位で分け直すとどうなるか」を次に依頼する
役割分担:ノートブックを書くのはエージェント。Colab で開いて ▶ を押し、出てきた結果を読んで次の依頼を決めるのはあびこさん。専門家に依頼するときの「仕様を伝える → 結果を受け取る → 判断する」と同じ形です。
2 / 論文を読む前の地図

「数え方」は3種類あります

第1回の「いちごの種カウンター」「神経節細胞チェッカー」は、実は3つのうちの1つでした。論文に出てくるAIは別の種類です。

① 第1回で体験済み
AIに画像を見せて聞く 「この画像にいくつありますか」とAIに聞く方式。準備は少ないが、AIの得意・不得意に左右される。ChatGPT型。
② Phase 2で体験
ルールを書いて数える 「この色より濃い塊を数える」など、人間が手順を決めて機械に数えさせる。仕組みは分かるが、条件が変わると壊れやすい。
③ Phase 2で体験(Colab)
お手本を見せて学習させる 正解のついた画像をたくさん見せて、機械自身に「数え方」を覚えさせる。論文の U-Net・YOLO・Vision Transformer はすべてこの仲間。
文献9本のうち、AIを使った7本はすべて③で、①のChatGPT型は1本もありません。③を自分の手で回す場所が Colab です。
3 / 文献9本

各論文のサマリーと、使われている手法

Driveの「Hirschsprung病 AI-文献」フォルダの PDF 9本を読みました。まず手法の内訳、次に1本ずつ。各カードの右上に「Colab で再現できる度合い」を付けています(詳しくは次の節)。

検出4細胞の位置を枠や点で当てる
塗り分け3細胞や神経の領域を塗る(セグメンテーション)
分類+地図1小片ごとに有無を判定し、ヒートマップに
深層学習以外1病理ソフトの中の「学習」機能
AIなし1人が目視で数える(正解の作り方)
人間側1AIを使う医師の訓練効果

※ 1本で複数の手法を使う論文があるため、合計は9を超えます。

Colab で再現できる度合い: ◎ 小さく再現できる ○ 一部を再現できる △ 雰囲気だけ Colab 以外で AI と体験
Demir 2025Lab Invest◎
分類+地図HE・凍結+永久・3施設ResNet-50(転移学習)・PyTorchコード公開

凍結切片の全スライドを小片に分け、神経節細胞がありそうな場所をヒートマップで示す。写真認識用に学習済みのモデル(ResNet-50)を病理画像向けに学習し直す「転移学習」。3施設で精度90〜93%、病理医10名の正答率は77%→85.8%、診断時間は半分に。

手法の要点:小片ごとの「あり/なし」二値分類 + 根拠の場所を示すヒートマップ(Grad-CAM)。

Wang 2026medRxiv査読前◎
検出塗り分けHPS染色・永久標本(直腸生検)YOLO26(Ultralytics)・U-Net(PyTorch)・QuPathでラベル付け

同じデータで U-Net(塗り分け)と YOLO26(枠で検出)を比較。感度はほぼ同じ(82.9% vs 79.1%)、YOLO の方が偽陽性が少なく34%速い。データは患者単位で分けている。

手法の要点:検出と塗り分けの2方式を、同じ物差しで比べる。どちらも学習済みモデルからの転移学習。

Duci 2023Pediatr Surg Int◎
塗り分けHE・永久標本(切除標本)U-Net ×2道具名の記載なし

切除標本の画像から神経節細胞・神経・肥厚神経の領域を塗り分ける。精度92%。ただし指標は「精度(accuracy)」だけで、患者単位でデータを分けたかは書かれていない。

手法の要点:画像を小片に切って U-Net で塗り分け、あとで貼り合わせる。

Greenberg 2024Diagn Pathol◎
検出HE・永久標本・4施設・3スキャナCNN(U-Net構造)+GANで水増し道具名の記載なし

自施設で作ったAIを、他の3施設と別の2機種のスキャナに持ち込んで壊れ方を調べた。施設が変わると偽陰性が増え(誤り率3.9%→最大10.8%)、スキャナが変わると色がずれる(3DHISTECH で 9.8%)。

手法の要点:モデルそのものより「条件が変わったときの評価」が主題。

Braun 2024JPGN○
深層学習以外AChE染色・凍結切片QuPath(ランダムフォレスト)・HALO

神経節細胞を数えるのではなく、AChE染色で神経線維の増え方から判定する。病理画像ソフト QuPath に入っている「学習」機能(ランダムフォレスト)で、患者単位の交差検証で AUC 0.96(直腸限定で 0.99)。

手法の要点:深層学習ではない古典的な機械学習。ピクセルの色・質感から「陽性領域」を塗り、その面積比で判定。

Greenberg 2021Sci Rep○
検出HE・永久標本独自CNN(詳細非公開)道具名の記載なし

HE染色の永久標本から神経節細胞の候補を見つけ、確からしい順に病理医へ提示する。細胞単位で感度96%・特異度99%、50症例で見逃しゼロ、読影時間を95%以上短縮。

手法の要点:病理医の見方(組織の層で絞る→周囲との関係で判定)を模した独自設計。中身は非公開。

Megahed 2025arXiv査読前△
塗り分け検出永久標本・染色の記載なし・30スライドVision Transformer ×3(転移学習)道具名の記載なし

病理医の手順どおり「筋層→神経叢→神経節細胞」と3段階で絞り込む。各段階に Vision Transformer を転移学習。筋層 Dice 89.9%、神経節細胞は適合率62〜67%・再現率79〜89%。単一施設。

手法の要点:大きな構造から小さな構造へ、段階ごとに別モデル。Transformer は第2回で見た LLM と同じ部品。

Greenberg 2023Arch Pathol Lab MedColab以外
人間側の研究HE・永久標本新しいAIなし(2021のAIを使用)

上のAIを使う非専門医5名に10分の説明をしたところ、正答が増え、専門医への紹介率が44.8%→29.6%に減った。ただし偽陽性はわずかに増えた。

手法の要点:AIではなく「AIを使う人」を評価する読影者実験。

福永 2022昭和学士会誌Colab以外
AIなしHu C/D免疫染色・永久標本・9例目視で計数

免疫染色した神経節細胞を人が目視で数え、5mmごとに地図化。吻合部で Meissner 約94個/cm・Auerbach 約110個/cm。腸間膜側と対側で分布が違う。

手法の要点:AIなし。人が数える=AIにとっての「正解」を作る作業そのもの。

4 / Colab でできること

Colab で再現・体験できる、論文の手法

9本の手法を、Colab で回せる「体験パッケージ」5つにまとめました。どれも公開・匿名の練習用データを使い、学習は1回5分以内に収まる規模にします。ノートブックはすべてエージェントが書きます。

PACKAGE A転移学習で「あり/なし」を判定し、根拠をヒートマップで見る◎
元の論文
Demir 2025(ResNet-50 転移学習+Grad-CAM)。Megahed 2025 の Vision Transformer も同じ枠組みで1段階だけ体験
やること
HE染色の小片画像(公開データ:癌転移の「あり/なし」など)を、写真認識用に学習済みのモデルで転移学習。混同行列と、判定の根拠を示すヒートマップを出す
データ
公開の HE 小片データセット(数百〜数千枚、匿名)
学習時間
GPU で 2〜5 分
分かること
「転移学習だから少ないデータでも動く」理由/混同行列を感度・特異度として読む/ヒートマップは「AIがどこを見たか」であって診断根拠ではない
あびこさんの研究に最も近い論文の、いちばん中核の部分です。
PACKAGE B検出(YOLO)と塗り分け(U-Net)を、同じデータで比べる◎
元の論文
Wang 2026(U-Net vs YOLO26)、Duci 2023(U-Net)
やること
細胞の位置に枠のついた公開データで、YOLO を転移学習して「枠と個数」を出す。同じデータで U-Net に塗り分けさせ、感度・偽陽性・速度を並べる
データ
公開の血球検出データ(数百枚)や核の塗り分けデータ。仕上げに自分で撮ったいちご画像
学習時間
YOLO 3〜5 分、U-Net 5 分程度
分かること
「検出」と「塗り分け」は出力が違う/カウントは検出の後処理/同じ論文の「感度は同じで特異度が違う」を自分の目で見る
神経節細胞を「数える」研究に、タスク種別として最も近いパッケージです。
PACKAGE C患者単位で分け直す・条件を変えて壊す(評価の作法)◎
元の論文
Greenberg 2024(施設・スキャナ差)、Wang 2026(患者単位分割)、Duci 2023(分け方が書かれていない)
やること
A・B で作ったモデルを、①画像単位ではなく患者(撮影元)単位で分け直して再評価 ②色味・明るさ・ピントを変えた画像や、別の施設由来の公開データで測り直す
データ
A・B と同じもの+条件を変えた画像
学習時間
再学習 数分(評価だけなら秒)
分かること
分け方を変えると精度が下がる理由(漏れ)/施設・スキャナが変わると落ちる/「精度92%」は何の指標で・どのデータで、と聞く習慣
依頼仕様書の「何症例・何施設・どのスキャナ・何をもって成功とするか」に直結します。
PACKAGE D深層学習を使わない「学習」:ピクセルの色と質感で塗る○
元の論文
Braun 2024(QuPath のランダムフォレスト)
やること
数枚の画像に「陽性/背景」を少しだけ塗り、ランダムフォレストにピクセル単位で塗り分けさせ、面積比を出す
データ
公開の染色画像 数枚
学習時間
1 分以内(GPU 不要)
分かること
「学習」は深層学習だけではない/ラベルが少なくても動く場面がある/ルール方式(②)と学習方式(③)の中間
QuPath というソフト自体は次の節(Colab 以外)で触ります。
PACKAGE E候補を出して、人が最終判断する形にする○
元の論文
Greenberg 2021(候補提示→病理医が判定)、Demir 2025 の読影者研究
やること
B の検出モデルの出力に「確からしさ」の閾値を付け、上位候補だけを並べて表示する。閾値を動かすと見逃しと誤警報がどう変わるかを見る
データ
B と同じ
学習時間
不要(表示だけ)
分かること
「AIが診断する」ではなく「AIが絞り込み、人が決める」設計/閾値=見逃しと誤警報のトレードオフ
Greenberg の中身は非公開なので、再現できるのは「設計」だけです。

Colab では無理なこと(=専門家に頼む領域)

スライド全体(WSI)1枚が数GBになる画像を丸ごと扱う仕組み。論文はすべてこれをやっている。
凍結切片の実データ公開データはほぼ永久標本。術中凍結切片の「難しさ」は、自院データがないと体験できない。
多施設・多スキャナGreenberg 2024 のような検証には、複数施設のデータそのものが要る。
大きなモデルの本格学習Megahed 2025 の3段階 Vision Transformer や GAN による水増しは、無料枠の時間と GPU では回りきらない。
術中という時間制約「何分で結果が出るか」は、実機・実運用でしか測れない。
患者データ全般Colab は Google のサーバーで動くので、匿名化の有無にかかわらず患者データは置かない。
5 / Colab の外で

Colab ではカバーできないが、AI を使えば比較的簡単に体験できること

学習そのものではなく、その前後にある作業です。ここはエージェントに道具を作らせたり、LLM に読ませたりする「AI活用」の出番で、環境は普通のブラウザとパソコンだけで済みます。

BEYOND 1「正解」を自分で作る:ラベル付けページを作らせて、自分で数える
元の論文
福永 2022(目視計数)、Greenberg 2021(病理医が細胞を囲む)、Wang 2026(医学生が一次ラベル→病理医が確認)
やること
エージェントに「画像をクリックして点や枠を打ち、保存するページ」を作らせ、練習用画像 20〜30 枚に自分でラベルを付ける。迷う画像が出ること、1枚にかかる時間を体で知る
道具
ブラウザだけ(第1回の「ちょっとしたツール」の延長)
このラベルをそのまま Package B の学習に使います。「誰が・どれだけ時間をかけて正解を作るか」が依頼仕様書の最重要項目。
BEYOND 2読影者実験を自作する:AIあり/なしで正答率と時間を測る
元の論文
Greenberg 2023(10分の説明で成績が変わる)、Demir 2025(AIヒートマップで正答率77→85.8%)
やること
Colab で学習したモデルをアプリにし、「AIの候補を見せる/見せない」の2条件で、自分・家族・同僚に判定してもらい、正答率と時間を記録する
道具
エージェントが作る判定アプリ(ブラウザ)+スマホから開ける公開ページ
「AIの性能」と「AIを使った人の成績」は別物、を自分の実験で確かめられます。
BEYOND 3病理医の実際の道具(QuPath)を、AI に教わりながら触る
元の論文
Braun 2024(QuPath で学習)、Wang 2026(QuPath でラベル付け)
やること
無料の病理画像ソフト QuPath を自分のパソコンに入れ、「この画像で細胞にラベルを付けるには」「ピクセル分類器を作るには」を LLM に聞きながら操作する
道具
QuPath(無料)+ LLM(画面を見せて質問)
専門家と組んだとき「アノテーションは QuPath で」という会話が普通に出てきます。自分で一度触っておくと依頼の解像度が上がります。
BEYOND 4「AIに聞く」方式(第1回)と、学習した専用モデルを同じ画像で比べる
元の論文
直接の論文はなし(9本に ChatGPT 型は1本もない、という事実そのもの)
やること
第1回の「神経節細胞チェッカー」(LLM に画像を見せて聞く)と、Package B の検出モデルに同じ画像を入れ、数・位置・かかる時間・一貫性を比べる
道具
第1回のチェッカー+ Colab のモデル
「なぜ論文は ChatGPT を使わないのか」に自分の答えが持てます。
BEYOND 5論文を LLM に読ませ、評価指標とデータの分け方を抜き出す
元の論文
9本すべて(特に Duci 2023 の「精度92%」、Demir 2025 の分け方)
やること
PDF を LLM に読ませて「何の指標で、どのデータで、患者単位か」を表にさせ、自分で原文と照らして要約の誤りに気づけるかを試す
道具
LLM(Claude / ChatGPT)だけ
Method を読む筋力は、専門家の説明を聞き分ける筋力と同じです。
BEYOND 6専門家が最初に聞く質問リストと、依頼仕様書(紹介状)を作る
元の論文
9本の「データ」節(症例数・スライド数・染色・スキャナ・誰がラベルを付けたか)
やること
研究相談スライドと9本を LLM に読ませ、「ML の専門家が最初に聞きそうな質問」を一覧にさせる。自院の状況を自分で埋め、Package で分かった「おもちゃが簡単だった理由」を確認項目に変換して、依頼仕様書に仕上げる
道具
LLM+テンプレート(エージェントに作らせる)
これが Phase 2 のゴールで、卒業時の成果物です。
6 / 全体像

論文の要素と、体験する場所の対応表

回ごとの順番はまだ決めていません。まず「何を・どこで体験するか」を合意し、その後に順番と回数を組みます。

論文に出てくることColab で回すColab の外で AI と
「正解」を人が囲む・数える
福永 / Greenberg 2021 / Wang
—BEYOND 1:ラベル付けページで自分で数える
転移学習+ヒートマップ
Demir / Megahed
PACKAGE A—
検出(YOLO)と塗り分け(U-Net)
Wang / Duci
PACKAGE BBEYOND 4:LLM 方式と比べる
患者単位の分割・条件が変わると落ちる
Wang / Greenberg 2024 / Duci
PACKAGE CBEYOND 5:論文から分け方を抜き出す
深層学習でない学習・QuPath
Braun / Wang
PACKAGE DBEYOND 3:QuPath を触る
候補提示→人が判断・読影者実験
Greenberg 2021・2023 / Demir
PACKAGE EBEYOND 2:AIあり/なしで測る
症例数・施設・スキャナ・誰がラベルを
全論文
—BEYOND 6:質問リスト → 依頼仕様書

どの順番になっても、必ずやる4つのこと

✓

自分でラベルを付ける。迷う画像が出ること、1枚にかかる時間を体で知る。

✓

学習に使った画像では評価しない。訓練用と評価用(できれば患者単位)を分ける。

✓

「おもちゃが簡単だった理由」を書き出す。そのまま専門家への確認項目表になる。

✓

最後に依頼仕様書を書く。動くものはあくまで手段で、これがゴール。

返事の仕方

Discord で一言ください。「この Package/Beyond はやってみたい」「ここが分からない」など、どんな粒度でも大丈夫です。それをもとに、回ごとの順番を一緒に組みます。

やってみたい項目 分からない点 相談したい