Transformerアーキテクチャの限界が顕在化——4つの技術ルートが突破口、次なるAIブームを制するのは誰か

图片

2017年の夏、GoogleのAI研究者たちは「Attention Is All You Need(アテンション・イズ・オール・ユー・ニード)」と題した論文を発表した。

論文はトランスフォーマー(Transformer)と呼ばれる新しいニューラルネットワークを解説していた。

その後、トランスフォーマーが長い系列データ、とりわけテキストの処理に極めて優れていることが実証された。

2026年の現在、トランスフォーマーは市場のあらゆる主要な大規模言語モデル(LLM)の中核エンジンだ。AIスタートアップSubquadraticの共同創業者兼CEO、ジャスティン・ダンジェル氏は「AI業界全体がトランスフォーマーの上に築かれている。コンピュータ科学の歴史で最も重要な発明の一つであり、世界を変えてしまった」と語る。

しかし同時に、トランスフォーマー技術にも疲れが見え始めている。最近のLLMの進展——推論モデルの開発や、モデルが一度に大量の入力を処理できる能力——は、中核技術の自然な延長ではなく、むしろ根本的な欠陥に当てられた継ぎ接ぎの応急処置のように映る。

ますます多くの科学者やエンジニアが考え始めている。技術はどう進化するのか。次世代AIはどんな姿なのか。LLMそのものは消えないだろうが、将来どのように構築されるのか。まだ結論は出ていない。

新興企業たちが相次いで参入し、現行技術の最前線を切り開こうとしている。敗れる競合も出るだろうが、こうした後発組の潜在能力は高く、現在の業界トップ企業と比べてむしろ競争優位を持つ可能性がある。

── 黄昏のネットワーク

まずは既存の技術的課題を整理しよう。トランスフォーマーの中核的な強みは、いわゆる「密なアテンション(dense attention)」機構にある。これはテキストの意味を一連の数値で符号化する。処理の過程で、テキスト中の各語(word)、または語の一部であるトークン(token)が、乗算によって他のすべての語やトークンと比較される。

密なアテンションはテキストの意味を極めて高精度に捉える。しかしテキストが長くなるにつれ、処理に必要な計算量は急激に膨らむ。1万語の英文ドキュメントでは、トランスフォーマーに5000万回もの乗算を要求することになる。これがLLMのエネルギー消費が膨大な主因だ。

計算コストは非常に高い。OpenAI社長のグレッグ・ブロックマン氏によれば、OpenAIの今年の計算資源支出は500億ドルに達する見込みだ。国際エネルギー機関(IEA)は、2030年までにデータセンターの総電力消費量が倍増すると予測している。

さらに悪いことに、新しいモデルが担うべきタスクにおいて、トランスフォーマーはしばしば力不足に陥る。テキストを逐語的に処理する仕組みの制約から、トランスフォーマーは大量の情報を同時に保持するのが苦手だ。言い換えれば、コンテキストウィンドウを大きく広げられない。

だがLLMがより高度なタスクに取り組むには、より大規模なデータ——文書ライブラリ全体、コードベース全体、あるいは他のLLMの出力——を受け取る必要がある。

推論モデルは、まず思考の連鎖(chain of thought)という下書きに自分用のメモを書き、そのメモを読んで推論を続ける。この方式もモデルが保持すべきデータ量を増やす。

LLMが大型化・高性能化するにつれ、トランスフォーマーのボトルネックはますます顕在化している。かつての中核的な強みが、いまや限界になっているのだ。

以下では、トランスフォーマーの限界を解決する4つの新しいアプローチを紹介する。これらの革新はLLMを作り替え、より高速で高効率、そしておそらくより賢くする可能性を秘めている。

ルート01 アテンション機構を再設計する

LLMをより速く、より低コストで動かすには、痛点を直撃してアテンション機構を変え、密なアテンションをスパースアテンション(sparse attention)に置き換えればよい。

スパースアテンションは、テキストブロック内の一部の語のペアだけを計算し、全部は計算しない。これによりLLMに必要な計算量を大幅に削減できる。

長年、研究者たちは多くのスパースアテンションを提案してきたが、意味を捉える点では密なアテンションに及ばなかった。もちろん、今は昔とは違うかもしれない。

先に触れたスタートアップSubquadraticは、開発したスパースアテンションが、検索やコード生成など複数のタスクで初めて主流のトップLLMに匹敵する性能を示したと主張している。この主張は極めて重いが、業界の一部にはなお懐疑的な声もある。

Subquadraticによれば、自社モデル「SubQ」は入力テキストの各段落について、どの語が重要かをリアルタイムで判断する。数万人のユーザーがSubQを試すためにウェイティングリストに登録したとされ、一般公開も間もなくだという。

もう一つのスタートアップManifest AIは別の道を選んだ。アテンション機構の働き方を改造するのではなく、全く新しい方式で置き換えるのだ。

同社が開発したのは「べき乗保持(power retention)」という機構だ。べき乗保持は現在のタスクに最も関連する情報だけを保存し、LLMが保持すべきデータ量が爆発的に増えないようにする。

従来のアテンションは、コンテキストウィンドウ内のすべてを記憶するようLLMに求める。SubQに代表されるスパースアテンションモデルは多くの個々の語を捨てるものの、見ている内容の概観は保持する。対照的に、べき乗保持はモデルに対し、コンテキストウィンドウの内容——モデルが現に見ているすべてのテキスト——についてのローリング要約を提供する。新しい情報が入れば、関連性の低い古い情報は捨てられる。

べき乗保持の基本原理は約10年前から存在する。Manifest AIは、技術を反復させ、トランスフォーマーベースのLLMに匹敵する製品を初めて構築したと主張する。さらに、わずかな再訓練でトランスフォーマーモデルをべき乗保持モデルに改造できるという。

この改造能力を証明するため、技術チームは既存のオープンソースコードモデルStarCoderをべき乗保持を搭載したPowerCoderに調整し、さらにBrumbyモデルを公開。その性能はアリババの通義千問(Qwen)の一部バージョンに匹敵するとしている。

Manifest AIのビジョンは、LLMが大量データのタスクを扱うとき、べき乗保持技術が第一の選択肢になることだ。共同創業者兼CTOのカーレス・ヘラダ氏は、自社技術は数時間の動画分析から、数週間連続でタスクを実行するAIエージェントの構築まで、幅広い応用場面を持つと述べている。

ルート02 より小型で柔軟なモデルをつくる

マサチューセッツ工科大学(MIT)発のスタートアップLiquid AIは、トランスフォーマーを根本から作り変えたり捨てたりするのではなく、自社開発の液体ニューラルネットワーク(liquid neural networks)とトランスフォーマーを組み合わせ、「液体基盤モデル(liquid foundation models、LFM)」を構築した。

Liquid AIのモデルは大半のLLMよりはるかに小さく、エネルギー消費も低い。同社はメルセデスなど自動車メーカー向けに、車載の小型チップに適合するモデルを開発済みだ。最新版は50ドル、低消費電力のラズベリーパイ開発ボードでも動作する。

年収1000万ドル未満の企業はLiquid AIの製品を無料で使えるとされ、モデルのダウンロード数は数千万回に達し、高い評価を得ている。

液体ニューラルネットワークは畳み込みニューラルネットワークの延長で、その着想は線虫の脳に由来する。畳み込みニューラルネットワークはトランスフォーマー以前から存在した別種のニューラルネットワークだ。液体ニューラルネットワークが際立つのは、適応機構を備え、新情報に応じてモデルが自らの振る舞いを動的に調整し、動かしながら学習できる点にある。トランスフォーマーベースのモデルにはこの能力がなく、訓練が終われば振る舞いのパターンは固定的だ。

Liquid AIの初期モデルは比較的基礎的だったが、すでにドローンを操縦し、車を運転できた。今では液体基盤モデルによって、同社は技術をスケールさせ、主流LLMに匹敵させようとしている。新モデルの性能は、自身の4倍の規模の競合——アリババの通義千問(Qwen)やGoogleのオープンソースモデルGemmaの一部バージョン——に匹敵する。

典型的なLLMは複数のトランスフォーマーを積み重ねて作られる。Liquid AIの最新のLFMはハイブリッド構成で、20%のトランスフォーマーと80%の液体ニューラルネットワークを含む。

この比率を算出したのは人間ではなく、同社が開発したモデル設計支援用の別のAIシステムだ。この「AIを設計するAI」は、液体ネットワーク、畳み込みネットワーク、トランスフォーマーなど様々なニューラルネットワークを大量に組み合わせ、その組み合わせを選別して性能と効率の最適なバランス点を見つけるという。

共同創業者兼CEOのラミン・ハサニ氏は、ニューラルネットワークの未来は可能性に満ちており、トランスフォーマーは始まりに過ぎないと考えている。

「人間の脳は汎用人工知能システムであり、消費電力はわずか20ワットだ。それをどう実現しているのか。まだまだ革新的なことができる」——ラミン・ハサニ氏

ルート03 テキストを一度に全部生成する

ほぼすべてのLLMは語を一つずつ出力する。これは人間が話し書く習慣に合致するが、コンピュータにとっては極めて非効率だ。LLMが文、さらには段落を一気に吐き出せるなら、速度とコストは最適化される。

この発想を実践する一社、Inceptionは拡散技術を利用してLLMを構築している。

拡散技術は、大半の画像・動画生成モデルを駆動する中核としてよく知られている。拡散型LLMの訓練方法はこうだ。まずランダムなピクセルグリッド(ブラウン管テレビのノイズのようなもの)を受け取り、全ピクセルを同時に処理し、どのピクセルを変更すべきか判断して、ノイズを高精細画像に変える。

このプロセスはテキストにも適用できることが分かった。Inceptionのチームは特定の訓練により、拡散型LLMがランダムな語の並びを受け取り、意味の通った文に変換できるようにした。この拡散型LLMも意味の符号化にはトランスフォーマーを使うが、テキストを一括で出力し、より少ないコストで多くのタスクをこなす。

共同創業者兼CEOのステファノ・エルモン氏は、自社の革新は依然として大規模トランスフォーマーモデルの範疇にあるが、複数のトークンを同時に予測できると説明する。だからこそ、市場の大半の方式と比べてテキスト生成がはるかに速く、費用対効果も高いのだ。

難所は、本来画像生成のために設計された技術をテキスト領域に移植する方法だ。

「画像処理では、青いピクセルを赤に変えるとき、中間の色を経て徐々に調整できる。だがテキストは違う。『猫』と『犬』の間には中間の語がない」——ステファノ・エルモン氏

エルモン氏はスタンフォード大学の研究者でもある。2024年、同氏はスタンフォードの同僚2人とともにテキストの隔たりを埋める数学的手法を見出し、それを基にテキスト対応の拡散モデルを訓練。その性能は2019年にOpenAIが発表したGPT-2に匹敵し、生成速度は10倍だった。

この成果を基にエルモン氏はInceptionを創業した。今、その野心は業界トップに向かう。Inceptionは最新モデルMercury 2の性能が2023年にOpenAIが発表した一部のGPT-4バージョンに匹敵し、速度も同様に10倍だとしている。

「このルートを非常に高く評価している。スケール拡大の潜在力がある。結局のところ、速度とコストはLLMの価値を測る中核基準だ。1ドル投じたとき、どれだけの知能が得られるか」——ステファノ・エルモン氏

拡散技術に賭ける企業はInceptionだけではない。Googleも積極的に試みており、Diffusion GemmaというプロトタイプLLMをすでに作っている。

ルート04 いっそテキストの世界から飛び出す

トランスフォーマーの限界に対して革新的な解決策を探るスタートアップの中で、Pathwayの理念は最も破壊的だ。同社はLLMを言語の束縛から解き放とうとし、その目標のためにDragon HatchlingというLLMを開発した。

これまでの最大の実績は、25万問以上の超難解な数独問題と対戦するベンチマークにある。複数のトップラボの主流LLMは一問も解けないなか、Dragon Hatchlingは97%以上を攻略した。

Pathwayが伝えたいのは、主流LLMは多くのタスクで優れているが、依然として多くの重要な種類の問題に対処できないという点だ。数独はその一例に過ぎない。

共同創業者兼CEOのズザンナ・スタミロフスカ氏は、LLMが現実の問題に対して真に独創的な解決策を生み出すには、トランスフォーマーの枠組みを出る必要があると述べる。トランスフォーマーはLLMにすべてをテキストで推論させるが、言語は一部の推論形式にとって最適な媒体ではないからだ。

Pathwayの解決策は、トランスフォーマーの根底にある数学的論理を変更し、アテンション機構を「状態空間(state space)」という数学的構造に置き換えることだ。

状態空間は情報を逐語的に符号化するのではなく、より抽象的な表現に圧縮する。これを基に、Dragon Hatchlingはテキストを読み書きできながら、単語の並びに依存しない推論パターンもシミュレートできる。これはモデルの効率を高めるだけでなく、理論上は他のLLMにできないタスクもこなせる。

「チェスや数学の問題は、長い文の形で人間の脳に存在しているわけではない。脳のひらめきは、必ずしも言語の形で現れない。推論が必ず言語に依拠しなければならないなら、それ自体が限界だと考える。主流LLMは数独の解き方の教程を読み、解法コードを書けるが、それは我々の求めるものではない。理想のモデルは書物の知識に縛られない。AIの目指す大海原は数独を解くことではなく、がんを克服することだ。しかし、この世に既成のがん克服マニュアルは存在しない」——ズザンナ・スタミロフスカ氏

出典:These startups are chasing the next big thing in LLMs

图片
関連記事

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.