OpenAIがCodexの「エンジン」を開放。AIエージェントはチャット画面を出る?

AI進化 AIニュース

AIエージェントという言葉を聞くと、まず思い浮かぶのはAIとのチャットで、画面に指示を書き、AIが答えを返す、あるいは、AIがコードを書いてくれる。

これまでのAIは、そんな「AIを使うための画面」を中心に発展してきました。

でも、OpenAIがCodexで進めている動きを見ると、これから向かっていく方向性が少し異なってきているのが見えてきまね。

今回、オープンソース化されたのはAIモデルそのものではなく、Codexの仕事を裏側で動かしている実行基盤「Harness」で、ここで面白いのは、AIエージェントを新しい画面として提供するのではなく、既に存在するソフトウェアの中へAIの仕事を組み込むための仕組みが前面に出てきたこと。

Codexで開放されたのは「AI」ではなく、その動かし方

Harnessは、AIへ質問を送って回答を受け取るための部品ではありません。

Codexのagent loopは、ユーザー、モデル、ツールのやり取りを実行する役割を担い、App Serverを使えば、会話状態を維持したり、イベントをストリーミングしたり、外部ツールを利用させたり、エージェントが承認を必要とする場面で処理を一時停止したりすることができます。

この違いはかなり大きいもので、チャット型のAIなら「このコードを直して」と頼み、回答されたコードを人間が確認するという使い方ができます。

しかし、実際の仕事では、それだけで完結しませんよね?

必要なファイルを探し、情報を取得し、ツールを使い、処理を進め、場合によっては人間の承認を待ってから次の操作へ進む必要があります。

つまり、AIに仕事をさせるには「どれだけ賢く答えられるか」だけでなく、答えを出すまでの仕事の流れをどう動かすかが必要になってくるわけですが、今回のHarness公開は、その部分を開発者が自分のソフトウェアに組み込めるようにするという動きなんです。

AIエージェントは「専用画面」を必要としなくなる?

この考え方は、今回突然出てきたものということでもなく、OpenAIは以前からCodex App Serverを公開し、Codexのコア機能を別のクライアントから利用できる仕組みを整えてきていました。

App Serverは、CodexのエージェントループをIDEやWebなど異なるクライアントから利用するためのインターフェースとして説明されていますし、CodexをコードレビュアーやSREエージェント、コーディングアシスタントなどとして製品へ組み込む用途をApp Serverの利用例として挙げています。

ここから見えてくるのは、「AIエージェント専用の画面を作る」という発想とは少し違う世界。

人間が普段使っているソフトウェアは、そのまま残り、その裏側でAIが情報を読み、必要なツールを呼び出し、仕事を進めていく。

人間がAIを使っているというより、使っているソフトウェアの一部がAIによって動くという状態で、この形なら、利用者は必ずしも「AIを使う」という操作を意識する必要がありません。

もちろん、これは「チャット画面がなくなる」ということではなく、チャットとは別の時間軸でエージェントを組み込むための技術が整備されてきているということ。

なぜAIの「賢さ」だけでは足りなくなったのか

エージェントが仕事をするようになると、モデルの性能だけでは、その実力を判断することはできません。

OpenAI自身の「Harness engineering」では、エージェントが仕事を進めるために、環境やフィードバックループなどを整えることの重要性が説明されていて、OpenAIのチームは、Codexを中心にソフトウェア開発環境そのものを設計する実験を行っていて、人間が意図を定め、エージェントが実行するという役割分担を示しています。

そのことを示す材料として、OpenAIはARC-AGI-3のpublic setにおける実験結果も公開しています。

GPT-5.6 Solについて、Harness側で「reasoningの保持」と「context compaction」という2つの設定を有効にしたところ、OpenAIの報告ではスコアが13.3%から38.3%へ上昇し、出力トークン数は6分の1になったのだとか。

ただし、これは「モデルそのものの性能が約3倍になった」という意味ではないですし、ARC-AGI-3のpublic setを使った、OpenAI自身による特定条件の実験結果の一つ。

AIを導入するとき、「どのAIか」だけでは不十分。

企業がAIを導入するとき、これまでは「どの生成AIを契約するか」という選択が中心で、ChatGPTなのか、Claudeなのか、それとも別のAIなのか。どのモデルが賢い?料金はいくら?などの要素を考えて意思決定していました。

しかし、エージェントを業務に組み込むようになると、それだけで決定するには不十分で、既存の業務ソフトのどこでAIを動かすのか?AIにどのデータを読ませるのか?どのツールを操作させるのか?そして、どの操作については人間の確認を必要とするのか?までを考慮しつつ、決定しなければなりません。

AIが「回答するだけ」なら、多少間違えても人間が読み直せますが、AIが実際の処理を進めるのであれば、どこまで任せるかという設計が必要になってきます。

だからこそ、今回のHarness公開を「Codexの便利な開発部品が増えた」というニュースだけで終わらせるのは少しもったいない。

OpenAIが公開してきたCodexの構造を見ると、AIエージェントの競争は、モデルの賢さだけでなく、そのモデルを仕事の流れの中でどう動かすかという領域まで広がっています。

仕事で使っているソフトの中に、情報を調べ、判断材料を整理し、ツールを操作し、必要なところだけ人間に確認する仕組みとして入り込んでくる。

そのとき問われるのは「一番賢いAIはどれか」だけではなく、「この仕事のどこまでをAIに任せるのか」という設計。

AIエージェントを「使うもの」から「ソフトウェアの中に組み込むもの」へ変えていくための部品が、表に出てきた出来事として、また新たな進化の方向性が提示されています。

タイトルとURLをコピーしました