DeepMind出身者が創設したInherent、AIの「チームメイト」がAnthropicとOpenAIを上回る研究論文複製性能を達成

DeepMindの元研究者らが設立したイギリスのAIラボが、彼らのAIエージェント「Faraday」は、AnthropicとOpenAIがこれまでにリリースしたどのシステムよりも正確に科学論文を複製できるという発表をした。

Share
Editorial illustration: A laboratory notebook lying open on a desk, its pages filled with handwritten equations and diagrams — MonstarX

DeepMind出身者が創設したInherent、AIの「チームメイト」がAnthropicとOpenAIを上回る研究論文複製性能を達成

DeepMindの元研究者らが設立したイギリスのAIラボが、アジアの開発者と起業家に衝撃を与える発表をした。彼らのAIエージェント「Faraday」は、AnthropicとOpenAIがこれまでにリリースしたどのシステムよりも正確に科学論文を複製できるという。DeepMind出身者が創設したInherentは、そのAIシステムが単なる研究アシスタントではなく、真の科学的なチームメイトだと主張している。このベンチマークが精査に耐えるなら、2026年の応用AI研究ツール領域において、最も重要な性能向上の一つとなるだろう。

何が起きたのか

2026年8月22日にTechCrunchで報道されたイギリスのAIラボInherentは、FaradayというAIエージェントをリリースした。その中核的な主張は明確だ。Faradayは、科学研究論文の複製というタスクにおいて、AnthropicとOpenAIの競合システムを上回ったということである。

複製は些細なベンチマークではない。AIシステムが公開された論文を読み、その方法論を理解し、実験セットアップを再現し、元の知見と一致する結果に到達する必要がある。人間が手取り足取り指導することなく、である。これは論文を要約したり、それについて質問に答えたりすることとは質的に異なる。Inherentによれば、Faradayはこれを自律的に行い、プロンプトで指示するツールというより、仕事を割り当てるコラボレーターのように振る舞う。

創設チームの経歴は重要だ。DeepMindは歴史的に地球上で最も厳密なAI研究環境の一つであり、AlphaFold、AlphaGo、そして多くのピアレビュー済みの革新的成果を生み出した研究所である。そのような文化から生まれた創設者は、「それは機能する」が実際に何を意味するのかについて、より高い基準を持つ傾向がある。これはInherentのベンチマークが完璧であることを保証するものではないが、Faradayの背後にある方法論が、平均的なスタートアップのプレスリリース主張よりも防御可能である可能性が高いことを意味する。

Faradayを「ツール」ではなく「チームメイト」と位置付けることは意図的で、哲学的に重要だ。これは設計哲学を示唆している。つまり、このシステムは十分な自律性を持って動作することを意図しており、研究者や開発者はタスクを任せて、単なる出発点ではなく意味のある成果を期待できるということだ。この枠組みが実世界の研究ワークフローとの接触に耐えるかどうかはまだ見えないが、ベンチマーク結果はそれに真摯に向き合う価値のある信頼性を与えている。

アジアにとって重要な理由

アジアの研究開発環境は転換点にある。シンガポール、韓国、日本、台湾、そしてますます東南アジア全域の大学は、世界レベルのAIおよびライフサイエンス研究を生み出している。同時に、これらの市場の多くでは、研究成果と商用応用のギャップは依然として大きい。科学的成果の複製と検証を加速できるツールは、学術界を支援するだけでなく、公開論文から本番環境対応の知見への時間を短縮する。

シンガポールと韓国の医薬品とバイオテクノロジー部門を考えてみよう。ここでは研究チームは野心に比べて小規模だ。Faradayクラスのエージェントが実験結果を自律的に複製できれば、5人の研究者チームが15人のチームの力で競争できる。同じロジックは、基礎モデルの上に構築するために競争しているアジア地域全体のAI研究ラボにも適用される。先行研究が実際に何を実証したのか、単に何を主張したのかではなく、それを理解することは重要なボトルネックなのだ。

アジアテック特有の言語とアクセスの側面もある。高価値な科学文献の相当な部分は英語で存在する一方、それに基づいて行動する必要がある研究者の多くは、中国語、韓国語、日本語、またはインドネシア語で作業している。研究を複製し統合できるAIエージェント(単に翻訳するだけではなく)は、歴史的に地域全体の知識移転を遅くしてきた摩擦の層を取り除く。

より広く言えば、Faradayの出現は、次の波の高価値AI応用が汎用チャットボットではないことを示唆している。それらは、狭く高リスクなタスクにおいて深い能力を持つドメイン特化型エージェントになるだろう。アジアの起業家が何を構築するかを評価する際、それは明確なシグナルだ。この次のAI市場の段階では、水平的な広さより垂直的な深さが勝つ。勝つチームは、科学研究、法的分析、財務モデリングなど、ドメインを選択し、本当に「チームメイト」というラベルを獲得するエージェントを構築する者たちだ。

開発者にとっての意味

開発者にとって、Faradayは具体的なアーキテクチャの問題を提起する。科学的複製のような精密なタスクに信頼できるほど確実に長期的なタスクを実行できるAIエージェントをどのように構築するのか?

Inherentが開示した内容に基づくと、短い答えは、よくプロンプトされた最先端モデル以上のものが必要だということだ。Faradayは複数ステップのエージェントシステムのようだ。一連のアクション計画を立て、実行し、中間出力を評価し、軌道修正できるシステムだ。これは検索拡張生成(RAG)パイプラインや標準的なチャットボットインターフェースの構築とは根本的に異なるエンジニアリング課題だ。

今日エージェントを構築しているなら、このストーリーから実践的なガイダンスとして以下のことが導き出される。

  • 評価が最も難しい部分だ。 Inherentが検証可能な結果を伴う論文複製という厳密で客観的なベンチマークを持っていたからこそ、FaradayがAnthropicとOpenAIを上回ったと主張することができるのだ。ドメインタスク用のエージェントを構築しているなら、コードを1行書く前に成功指標を定義しよう。「それは機能した」が数値的に何を意味するのか?
  • タスク分解はモデル選択より重要だ。 モデルはコンポーネントだ。アーキテクチャ(複雑なタスクをサブタスクに分割する方法、障害の処理方法、中間出力の検証方法)が本当のエンジニアリングが存在する場所だ。強いタスク分解層を持つ弱いモデルは、単にエンドツーエンドでプロンプトされた強いモデルを上回ることが多い。
  • 自律性は信頼スキャフォルディングを必要とする。 Faradayを「チームメイト」と呼ぶことは、システムが意味のある期間、監視されずに動作できることを意味する。その信頼を構築するには、ロギング、説明可能性、そして優雅な障害モードが必要だ。ユーザーは監査できないエージェントに仕事を委譲しない。

プラットフォーム側では、これはまさにMonstarXが支援するために構築された開発パターンだ。エージェントシステムを構築しているアジアの開発者は、オーケストレーション層を処理するインフラストラクチャが必要だ。モデルをデータソースに接続し、マルチステップワークフロー全体で状態を管理し、外部API及び研究データベースへの適切なコネクタを公開する。すべてのチームがそのスキャフォルディングを一から再構築することを強制することなく。

Faradayのストーリーはまた、特化についての重要なポイントを強化する。Inherentは汎用研究エージェントを構築しようとしなかった。彼らは1つのタスク(複製)を選択し、それに向けて最適化した。アジアで構築している開発者はそれを真摯に受け止めるべきだ。広く構築したいという誘惑は強い。特に投資家にTAMを売り込みたいときは。しかし実際に採用されるエージェントは、人間が単独でできるよりも1つの高価値なことをより良くできるものだ。

もう1つの実践的な注記。研究複製のユースケースはソフトウェア開発に直接的な類似物がある。コードレビュー、テスト生成、そして最も関連性が高いのはバグの再現だ。