── チャット型・エージェント型、MCP・Skills・RAG、そしてリモート操作まで。世に出ている道具を「怖くない」「見分けられる・選べる」ようにする回
種明かしシリーズもいよいよ最終回です。第2回は「頭脳」の中身(LLMのしくみ)、第3回は「体とすみか」(プログラムの構造と実行環境)を見ました。今回はその続きとして、世に出回っている道具そのものの「地図」を描きます。ChatGPT、Claude Code、MCP、Skills、RAG ── 名前だけは聞いたことがある言葉が並ぶ回ですが、これらは全部「第2回で見た同じ脳を、どんな体・どんな装備に載せているか」の違いにすぎません。
今日のゴールも変わりません。暗記ではなく、見分けて選べるようになることです。「これはチャット型だ」「これはエージェント型だ」「これはMCPの出番だ」と看板を見て仕分けられるようになれば、次に何かを頼むときに迷いません。ただし今日は地図を眺めるだけで終わらせません。後半はあびこさん自身のキーボードで、普段お使いのCodexを実際に触っていただく回でもあります。
ここまでの3回を、1行ずつ振り返ります。第1回は「いきなり作ってみる」体験。第2回は頭脳の中身(LLMのしくみ・トークン・学習と推論)。第3回は体とすみかの構造(プログラムの中身・クライアントとサーバー・ローカルとクラウド)でした。今日は最後のピース、世に出ている道具そのものの地図です。
同じ人間の脳でも、内科医として働くか、外科医として働くか、研究者として働くかで「見た目の役割」がまったく違います。AIも同じで、中身の脳(LLM)はほぼ共通なのに、それをどんな入れ物・どんな装備で使わせるかによって、ChatGPT・Claude Code・第1回で作ったツールという、まったく別物に見える製品が生まれます。今日はその入れ物の違いを一通り歩きます。
新しい単語がたくさん出てきますが、どれも「そういう仕組みがある」と知っておく程度で十分です。使いこなしは、これから先の回で実地に覚えていきます。
世の中に「AIツール」と呼ばれるものは無数にありますが、ほぼ全部が同じ1個の脳(LLM)を、3通りの体に載せたものと考えると驚くほど整理できます。
第1回で一緒に作った🍓いちごの種カウンター・🔬神経節細胞チェッカー・👕人物服装判定ツールは、すべて③組み込み型でした。あびこさんが会話をした覚えがないのは当然で、あのツールはAIと「会話」していたのではなく、裏側でAPIを1回だけ呼び出していただけだったからです(第2回・第3回の内容そのものです)。
今日、新しく扱うのは①と②の違い、そして②の周辺にある装備(MCP・Skills・RAG・リモート操作)です。
ここが今日いちばん時間をかける章です。あびこさんが第2回のときに投げてくれた素朴な疑問 ──「AI使用したって言ってるけど、人間がコード組むのと何が違うの? 速さや正確性だけの問題なのか。それとも自動でやってくれるところで初めてAIとして線引きされるのか。」に、ここでもう一度、正面から答えます。
チャット型は、人間が1回話しかけて、AIが1回答える、というキャッチボールの連続です。次に何をするかは常に人間が決め、AIはそのつど「呼ばれたら答える」だけの存在です。
一方エージェント型(Claude Code や Codex)は、指示を1回受け取ったあと、自分のフォルダの中に住み着いたまま、次のループを自分で何度も回し続けます。あびこさんに引き寄せると、普段使っているChatGPTがチャット型、同じOpenAI社のCodexがエージェント型にあたります。
このループを、人間がいちいち指示しなくてもAIが自分の判断で何周も回すところが、チャット型との決定的な違いです。
そして、ここでシリーズを通じての種明かしをひとつ。第1回のレッスンで柴田が手元で使っていたのは、まさにこの Claude Code というエージェント型ツールでした。「AIがフォルダの中身を読んで、コードを書いて、実行して、動くか確かめて……」を目の前で繰り返していたあの画面が、今日名前を知った「エージェント型」の実物です。
ここで、この先ずっと使う区別をひとつ。ChatGPTもCodexも、中で答えを考えているのはモデル(第2回で見たLLM本体=頭脳)です。一方、その頭脳を包んで「会話を覚えておく」「ファイルを読み書きする」「コマンドを実行する」「勝手に危ないことをしないよう許可を求める」「長くなった会話を要約する」といった仕事の段取りを担っているのは、モデルとは別のプログラムです。これをハーネス(harness:馬具、転じて「頭脳を仕事に繋ぐ枠組み」)と呼びます。
ここからはキーボードをあびこさんに握っていただきます。第1回で「柴田が打つとすごいものを見た、で終わる」とお話ししましたが、今日はエージェント型ツール(普段お使いのCodex)の中に、道具そのものへの命令ボタンがあることを、実際に手を動かして確かめます。
Codexの入力欄で、何も文章を書かずに/(スラッシュ)だけを打ってみてください。コマンドの一覧がポップアップします。
/AIへの言葉ではなく、道具そのものへの命令。電子カルテで言えば、記載欄ではなくメニューボタンにあたる
いきなり何かを変更するコマンドではなく、状態を見るだけのコマンドから試します。
/status今の設定とトークンの使用量を確認する。何も変更されない/model今使っているモデルと、推論の強さ(じっくり考えるか、素早く返すか)を選び直す
次のコマンドは、あとの第6章につながる伏線です。
/init今いるフォルダの中身を読み、AIへの指示書ファイル(AGENTS.md)を自動生成させる
実行すると、そのフォルダにAGENTS.mdというファイルが新しくできあがります。これが何なのかは、次の章でじっくり扱います。
| /diff | これまでの変更点の差分を見る |
|---|---|
| /review | 今の変更内容をAIにレビューしてもらう |
| /compact | 会話が長くなってきたら、それまでのやり取りを要約して続ける |
| /new | まっさらな新しい会話を始める |
| /resume | 過去に保存された会話を選んで再開する |
今日のように、あびこさんはCodex、柴田はClaude Codeを使う場面が今後も出てきます。呼び方は違っても、目的で見ると対応関係があります。
| 目的 | Codex CLI | Claude Code |
|---|---|---|
| 指示ファイルを自動生成 | /init(AGENTS.md作成) | /init(CLAUDE.md作成) |
| モデルを切り替える | /model | /model |
| 会話を要約して続ける | /compact | /compact |
| まっさらな会話を始める | /new | /clear |
| 過去の会話を再開 | /resume | /resume |
| コードをレビュー | /review | /review |
| 変更点を見る | /diff | /diff |
| 現在の状態・設定 | /status | /config, /context |
| 許可の設定 | /permissions | /permissions |
| MCP接続の管理 | /mcp | /mcp |
| メモリの管理 | /memories | /memory |
| ヘルプ | (/ で一覧) | /help |
第2章で触れた③組み込み型を、今度は自分の手で体験します。第1回の3ツールがまさにそうだったように、③はAIと「会話」するのではなく、プログラムがAPIを1回呼び出す形で動きます。ここではAnthropic(Claudeを作っている会社)のAPIを、あびこさん自身のアカウントで実際に叩いてみます。
python client.py "AIコーチングとは何か、一言で教えて"できあがったクライアントアプリを実際に動かす例。中身はCodexに作ってもらったもので構わない
今、画面に返ってきた1回の応答が、まさに従量課金でクレジットを消費した瞬間です。Anthropic Consoleの使用量画面では、どれだけのクレジットを使ったかを確認できます。ふだんお使いのChatGPT・Codexの月額サブスクリプションとは別の財布が動いている、という感覚をここで持ち帰ってください。
第2回でお話しした通り、AIは会話をしても賢くなって次回に持ち越すわけではありません(学習と推論は別の作業でしたね)。セッションが変われば、AIにとってはまた初対面です。この「AIは毎回初対面」問題に対して、実践では2つの別々の仕組みで補っています。
ひとつ目は、フォルダの中に置いておく指示書ファイルです。CodexではAGENTS.md、Claude CodeではCLAUDE.mdという名前のテキストファイルで、AIが起動するたびに毎回読み込まれます。ちょうど先ほど/initで作ってもらったのが、これです。
書く内容は、「このプロジェクトは何か」「守ってほしいルール」「よく使うコマンド」など。置き場所は2階層あり、全プロジェクト共通の置き場所(自分のPCのホーム側)と、プロジェクトごとの置き場所(作業しているフォルダ側)の両方に置けます。
ふたつ目はメモリです。会話の中から「この人はこういう好みだ」「この作業はここまで進んだ」といったことを、AI自身がメモとして保存し、次回のセッションで思い出す仕組みです。指示書とは違い、こちらは人間が書くのではなく、AIが自分の判断で書き足していきます。
Codexのローカルメモリは既定でオフになっています。使うにはデスクトップアプリの設定(Personalization > Enable memories)で有効化する必要があり、保存先は自分のPC内の~/.codex/memories/です。なお、これはChatGPT本体が持っているメモリ機能とは別物である点に注意してください。ちなみにClaude Codeのauto memoryは既定でオンになっています。
使い分けの原則はシンプルです。必ず守ってほしいルールは指示書ファイルに書く。メモリはあくまで補助として使う ── これはCodex・Claude Code双方の公式ドキュメントが推奨している考え方です。
MCP(Model Context Protocol)は、AIに「新しい手」を接続するための共通の差し込み口の規格です。エージェント型ツールは、標準ではフォルダの中のファイルしか触れませんが、MCP経由で道具をつなぐと、カレンダーを見に行ったり、ブラウザを操作したり、外部のサービスに問い合わせたりできるようになります。
| カレンダーMCP | AIが予定を確認したり、新しい予定を入れたりできるようになる |
|---|---|
| ファイルMCP | AIが指定した場所のファイルを読み書きできるようになる |
| ブラウザMCP | AIが実際にブラウザを操作して、Webページを見に行ったり検索したりできるようになる |
第1回で作った3ツールが「①指示文②画像③返事の書式」という決まった1回のやり取りだけだったのに対し、MCPでつながった道具を持つエージェント型AIは、必要に応じて自分で道具を選び、使いに行くところが違います。さきほどの早見表にもあった通り、CodexにもClaude Codeにも/mcpコマンドがあります。同じ規格に対応しているからこそ、どちらのツールでも同じやり方でMCPの接続を確認・管理できるのです。
Skillsは、AIに渡す手順書です。「こういう依頼が来たら、この順番で、こう確認しながら進めてほしい」という段取りを、あらかじめ文書にしてAIに読ませておく仕組みです。
第1回で神経節細胞チェッカーを作ったとき、指示文(プロンプト)を書き換えたのを覚えているでしょうか。Skills は、あの「指示文を書いて渡す」作業を、使い回せる文書として1回だけ用意しておくものだと考えると近いです。一度書いておけば、次に似た依頼をするたびに「あのやり方でやって」と呼び出すだけで済みます。Codexでは/skillsコマンドで、用意されている手順書を呼び出せます。
第2回でお話しした通り、LLMは学習した時点までの知識を丸暗記している状態で答えます(学習と推論は別の作業でしたね)。つまり、学習した後に出た新しい情報や、そもそも学習していない社内・院内だけのローカルな情報については、知らないのに、それらしく答えてしまうことがあります。これが「ハルシネーション(もっともらしい誤答)」の主な原因のひとつです。
RAG(Retrieval-Augmented Generation)は、AIに質問が来たとき、まず関連する文書(院内マニュアル・ガイドライン・最新の資料)を検索して持ってこさせ、それを読んだうえで答えさせることで、丸暗記だけに頼る誤りを減らす仕組みです。
| 院内マニュアルQA | 院内の運用マニュアルをAIに検索させ、その内容に基づいて質問に答えさせる |
|---|---|
| 文献に基づく回答 | 最新の論文やガイドラインを検索してから、それを根拠に回答させる |
RAGを使えば万能というわけではありませんが、「学習時点の記憶だけに頼るか」「その場で調べてから答えるか」という違いを知っておくと、AIの答えをどこまで信じてよいかの見当がつきやすくなります。
「資料を読ませる」と言っても、AIは分厚いマニュアルを毎回頭から読み直しているわけではありません。第2回で見たとおり、LLMが一度に読める量(コンテキスト窓)には上限があり、全部を渡すと入りきらないか、入っても肝心の一文を見落とします。そこで「前もって小分けにして索引を作り、質問のたびに関係する部分だけ引き抜いて読ませる」という手順を踏みます。
| 手順 | やること | たとえるなら |
|---|---|---|
| ① ちぎる 前もって | 資料を見出しや段落ごとの小さな断片(チャンク)に分ける。1断片は数百字程度 | 分厚い医学書を、項目ごとの付箋に書き写しておく |
| ② 座標を付ける 前もって | 各断片の「意味」を数値の並び(ベクトル)に変換し、索引(ベクトルデータベース)にしまう。第2回の「言葉を数値にする」の応用 | 付箋ひとつひとつに、内容の近さで並ぶ棚番号を振る |
| ③ 質問を同じ座標に 質問のたび | 質問文も同じ方法で数値に変換し、座標が近い断片を数個だけ取り出す | 質問に一番近い棚から、付箋を数枚だけ抜く |
| ④ 読ませて答える 質問のたび | 取り出した断片を質問と一緒にLLMに渡し、「この根拠に基づいて答えて」と指示する | 抜いた付箋だけを机に置いて、読んでから答えてもらう |
上の手順①で資料を「ちぎる」には、まず中身が文字として取り出せる必要があります。ここでファイルの種類が効いてきます。第3回で「第1回に作ったツールの中身は、文字が並んだだけのテキストファイルだった」と見ましたが、その延長の話です。
エージェント型AIが自分のPCの中に常駐しているなら、「外出先のスマホから、家のPCに常駐しているAIに指示を出す」ということもできそうだ、と思うかもしれません。実際にできます。ただし、家のPCをそのままインターネットに公開するのは危険なので、自分の機器同士だけをつなぐ閉じた通り道が必要になります。
Tailscale は、自分が持っている複数の機器(スマホ・自宅PC・ノートPCなど)だけを、インターネット上に仮想のプライベート・ネットワークとしてつなぐサービスです。これをVPN(Virtual Private Network=仮想専用網)と呼びます。
ここまで見てきたChatGPTやClaudeは、どれも自分の機器の外にある巨大なサーバー(Anthropic や OpenAI のデータセンター)で動くAIに、通信を通じて質問を投げていました。実は、LLM自体を自分のマシンの中だけで動かすという選択肢もあります。
「そういうものがある」という名前だけ知っておけば、今日は十分です。
「自分のマシンで動かす」ためには、LLMの本体(第2回で見た、学習で得た膨大な数値=重み/ウェイト)を手元に持ってくる必要があります。ここで、世の中のLLMは大きく2つに分かれます。
ここまでの話をふまえると、あびこさんが普段使うCodexも、柴田が使うClaude Codeも、クローズドモデルを通信して呼んでいることになります。どちらも中で動くモデル(頭脳)を/modelで切り替えられ、ラインナップは「賢さ・遅さ・値段」の段階で並んでいます。
| 段階 | Codex(OpenAI) | Claude Code(Anthropic) | 向いている場面 |
|---|---|---|---|
| 最上位 | gpt-5.6-sol | Fable 5.1 | 長く複雑な作業、原因調査、設計判断。一番賢いが、遅く高い |
| 高性能 | (solが兼ねる) | Opus 5 | 込み入った推論・計画。Claude Codeでは上位プランの既定 |
| 日常 | gpt-5.6-terra | Sonnet 5 | 普段の作業の主力。速さと賢さのバランス。Claude Codeでは標準プランの既定 |
| 軽量 | gpt-5.6-luna | Haiku | 決まりきった作業(抽出・分類・整形)を速く安く |
| 切り替え | /model | /model | 会話の途中で変えてよい |
| 考える深さ | Low〜Ultra(既定 Medium) | low〜max(既定 high) | 同じモデルでも「どれだけ考えてから答えるか」を調整できる |
これで種明かしシリーズ(第2〜4回)は完結です。次はいよいよ、あびこさん自身の関心(画像から同じものを検出する)に近づいていくPhase 2に進みます。
暗記は不要です。今後の回で出てきたときに、ここに戻って引いてください。
| エージェント型 | 指示を受けたあと、「読む・書く・実行する・見る・判断する」のループを自分で何度も回すAIツール。Claude Code / Codex など。 |
|---|---|
| チャット型 | 人間が話しかけ、AIが答える1問1答の対話を繰り返すAIツール。ChatGPT / Claude / Gemini など。 |
| 組み込み型 | アプリの裏側でAPI経由の1回きりの呼び出しとして動くLLM利用形態。第1回で作った3ツールがこれにあたる。月額サブスクリプションではなく、従量課金のクレジットを消費する。 |
| APIキー | プログラムからAPIを呼び出す際に使う、本人確認用の合言葉。パスワードと同じ扱いで、コードに直書きせず・他人に見せず・履歴にも残さない。 |
| MCP | Model Context Protocol。AIに「新しい手」(カレンダー・ファイル・ブラウザ操作など)を接続するための共通規格。 |
| Skills | AIによく頼む作業の手順をあらかじめ文書にまとめておき、誰が頼んでも同じ品質で実行させる仕組み。 |
| RAG | Retrieval-Augmented Generation。質問に答える前に関連文書を検索して読み込み、それを根拠に回答させる仕組み。丸暗記だけに頼るハルシネーションを減らす。 |
| ハルシネーション | LLMが、もっともらしいが事実と異なる内容を答えてしまう現象。 |
| ハーネス | モデル(LLM本体)を包んで、会話の保持・道具の貸し出し・許可の確認・メモリ・要約などの段取りを担うプログラム。ChatGPTはチャット型、Codex / Claude Codeはエージェント型のハーネス。/コマンド・MCP・Skillsはハーネス側の機能。 |
| チャンク/ベクトル検索 | RAGで資料を段落ごとの小片(チャンク)に分け、各小片の意味を数値の並び(ベクトル)にして索引化し、質問と意味が近い小片だけを取り出す検索方式。言葉が一致しなくても探せる。 |
| Markdown | 「# 見出し」「- 箇条書き」だけで構造を書く、中身が文字そのもののファイル形式(.md)。AIが最も読み書きしやすく、AGENTS.md / CLAUDE.md もこの形式。 |
| OCR | スキャン画像や写真から文字を読み取る処理。スキャンPDFは文字情報を持たないため、OCRを挟まないとAIは中身を読めない。 |
| VPN | Virtual Private Network。インターネット上に、自分(や許可した人)の機器だけがつながる仮想の専用網を張る仕組み。 |
| Tailscale | 個人の複数の機器だけを簡単につなげるVPNサービスの一例。外出先から自宅のPCに安全にアクセスするために使える。 |
| ローカルAI | LLM本体を自分のマシンの中だけで動かし、データを外部に送らずにAIを使う方式。Ollama / Mac Studio / NVIDIA DGX Spark など。 |
| オープンウェイト | LLMの本体(重み)が公開され、誰でもダウンロードして自分のマシンで動かせるモデル。gpt-oss / Llama / Gemma / Qwen / DeepSeek など。ローカルAIの前提。 |
| クローズドモデル | 本体が非公開で、事業者のサーバーに通信して使うモデル。ChatGPT(gpt-5.6系)・Claude(Fable / Opus / Sonnet / Haiku)・Gemini など。最先端の性能はこちら。 |
| スラッシュコマンド | 入力欄の先頭に/を打つことで呼び出す、ツール自体への命令。/init・/model・/compactなど。メッセージ先頭にあるときだけ効く。 |
| AGENTS.md | Codexが起動のたびに毎回読み込む指示書ファイル。プロジェクトは何か・守ってほしいルールなどを人間が書いておく。/initで自動生成できる。 |
| CLAUDE.md | Claude Codeにおける AGENTS.md 相当の指示書ファイル。役割・書き方は同じ。 |
| メモリ | 会話から得た情報をAI自身が保存し、次回のセッションで思い出す仕組み。人間が書く指示書ファイルとは違い、AIが自分の判断で書き足す。Codexは既定オフ、Claude Codeのauto memoryは既定オン。 |