コンテンツにスキップ
メインサイト ニュース コンソール

Falcon TST 2.0が権威ある評価で首位を獲得、時系列基盤モデルの金融活用を推進

· 量子位
国内AI

Ant International は先日、自社開発の時系列 AI 予測基盤モデル「Falcon TST(Time-Series Transformer)」2.0 を正式に発表した。Falcon TST 2.0 は、世界的に権威のあるベンチマークテストで最高水準(SOTA)の成績を収め、平均絶対スケールド誤差(MASE)を 0.666 まで低減し、世界トップクラスの複数のテクノロジー企業が開発した時系列予測モデルを上回った。同モデルは、クロスボーダー決済における為替リスク管理向けに開発されたもので、今後は EC サプライチェーンの需要予測や航空運航管理など、さらに多くの業界シナリオへの展開が予定されている。

現在、Barclays、Citibank、Deutsche Bank、Standard Chartered などの大手金融機関が Falcon TST 2.0 をキャッシュフロー予測や為替管理に活用し、流動性リスクエクスポージャーの予測能力を高めている。Falcon TST 2.0 の予測精度はすでに安定して 93% を超えており、金融以外にも物流、航空、EC などの業界へ展開できる実用性を備えている。

2025 年以降、Amazon Chronos-2、Google TimesFM 2.5、Salesforce Moirai 2.0、IBM FlowState が相次いで、多変量、長コンテキスト、確率予測、異なるサンプリングレートへの適応といった能力を前面に打ち出してきた。一方、金融市場における低い S/N 比、レジーム転換、ファットテールリスク、クロスマーケット連動性により、汎用ベンチマークでの優位性を安定した金融予測収益へ直接転換することは難しい。

Ant International の Falcon TST の進化は、その典型例である。2025 年には、まず為替エクスポージャーと資金管理で実運用上の検証を完了し、2026 年には Falcon-2.0 によって単変量予測の効率を高めるとともに、Falcon-X によって異種多変量間の関係モデリングを補完した。Falcon TST 2.0 は、「汎用時系列基盤能力 + 金融業務プロセスによる検証」を組み合わせた専門特化の試みであり、継続的な改良と着実な進歩は、AI と金融の融合領域における Ant International の先駆的な取り組みを示している。

一、金融時系列が汎用基盤モデルの実力を検証

汎用時系列基盤モデルは、データセットをまたいだ明確な転移能力をすでに備えている。 Salesforce AI Research が 2024 年 11 月に公開した GIFT-Eval ベンチマークは、28 のデータセット、14.4 万本を超える時系列、1 億 7,700 万個のテストデータポイントを対象とし、テストセットと重複しない約 2,300 億個の事前学習データポイントも備えている。このベンチマークにより、業界は「1 つのデータセットに対して 1 つのモデルを学習する」方式から、「一度事前学習し、タスクをまたいでゼロショット予測を行う」方式へと移行した。Google TimesFM、Amazon Chronos、Salesforce Moirai などのモデルもその後急速に進化し、主眼は単一の予測精度から、周波数、変数、不確実性出力をまたぐ能力へと広がっている。

金融市場は、汎用モデルに対してより厳しい検証を要求する。 金融収益率は一般に、低い S/N 比、ファットテール、ボラティリティ・クラスタリング、レジーム転換といった特徴を持つ。さらに、日中の相場、日次終値、金利カーブ、マクロデータには、周波数の不一致、祝日のずれ、欠損値などの問題も存在する。マンチェスター大学、ユニバーシティ・カレッジ・ロンドンなどの研究者が 2025 年 11 月に公開した大規模な金融実証研究のワーキングペーパーでは、既存の事前学習済み TSFM をそのままゼロショット予測や通常のファインチューニングに利用した場合、全体的な性能は低かった一方、金融データで再度事前学習を行うと、予測性能と経済的リターンが明確に改善した。この結果は、汎用事前学習が価値ある時間パターンの事前知識を提供する一方で、金融分野では依然として学習分布と対象タスクの適合性が極めて重要であることを示している。

金融 TSFM の価値は、「安定的に取引収益を生み出すこと」と区別して考える必要がある。 2026 年 6 月、米国の流動性が高い 5 銘柄を対象とした独立研究で、TimeGPT、TimesFM 2.5、Moirai 2.0、Chronos、Chronos-2 などのモデルが比較された。その結果、TSFM は 10 タスク中 8 タスクで最良の結果を得たものの、ランダムウォークベースラインに対する改善幅は全体として小さく、有意性検定を通過したタスクは一部にとどまった。また、META に関する 2 つのタスクでは、ローカルな教師あり学習で訓練した iTransformer が依然として上回った。したがって金融機関にとっては、TSFM を転移可能な予測基盤および開発効率化ツールと位置付け、ドメインデータ、ローリング・バックテスト、リスク制約によって二次検証を行うのが適切である。

二、主流 TSFM は多変量、長コンテキスト、確率予測へ移行

Chronos-2 は、Amazon の技術路線を単変量予測から汎用コンテキスト学習へと前進させた。 Amazon は 2025 年 10 月 20 日、1 億 2,000 万パラメータの Chronos-2 を発表した。同モデルは単変量、多変量、共変量条件付き予測をネイティブにサポートし、Group Attention によって関連する系列間でコンテキスト情報を共有する。

ここで区別しておく必要がある。初代 Chronos が「スケーリングと量子化を行って離散 Token に変換し、その後、言語モデルの交差エントロピーで学習する」方式を採用していたのは事実だが、Chronos-2 では新たなグループアテンションと汎用コンテキスト学習の仕組みが導入されている。そのため、「数値のビニングによってテール部分の精度が制限される」という評価を新バージョンに単純に適用することはできない。Amazon が公表した「勝率 90% 超」は、Chronos-2 と Chronos-Bolt の直接比較におけるものであり、GIFT-Eval 総合ランキングでの勝率ではない。Chronos-Bolt の「最大 250 倍の推論高速化、メモリ使用量 20 分の 1」も、初代の同規模 Chronos と比較した結果である。

TimesFM 2.5 は、より少ないパラメータ数によって長いコンテキストと連続分位点予測を実現した。 Google Research は 2025 年 9 月 15 日、TimesFM 2.5 を発表した。モデル規模は 2.0 版の 5 億パラメータから 2 億パラメータへ削減され、コンテキスト長は 2,048 から最大 16,384 へ拡張された。さらに、オプションで 3,000 万パラメータの連続分位点予測ヘッドを追加でき、最大 1,000 ステップの分位点予測をサポートする。

その後、Google は 2025 年 10 月に XReg 共変量のサポートを再導入し、2026 年 3 月には Agent スキル用インターフェースを追加、4 月には LoRA に基づくファインチューニングのサンプルを追加した。したがって、「2.5 版が 2026 年に分位点、LoRA、Agent を一度に追加した」という説明は正確ではない。モデルのリリースとエコシステムの強化は、それぞれ異なる時点で行われたものである。

Moirai 2.0 は、時系列基盤モデルがパラメータ数を増やし続ける必要はないことを示した。 Salesforce は 2025 年 8 月 8 日、Moirai 2.0 を発表した。初期の Moirai で採用されていた Masked Encoder を Decoder-Only Transformer に変更し、学習目標を分位点損失と多 Token 予測に改めた。また、欠損値情報の埋め込み、ランダム Patch マスキング、データ品質フィルタリングも追加した。

Salesforce が公開した小型版は約 1,140 万パラメータで、従来の Moirai Large と比べてパラメータ数を約 96% 縮小し、推論速度を 44% 向上させた。当時の GIFT-Eval におけるテストデータ漏洩のないモデルでも、最も優れた MASE を達成した。その意義は、TSFM の競争軸が「より大きなモデル」から「より適切なデータ、損失関数、学習戦略」へと移行している点にある。

FlowState は、サンプリング周波数の変化に対する Transformer の適応不足に対し、状態空間モデルで応答した。 IBM Research は 2026 年 7 月 6 日、ICML 2026 の論文 FlowState を公開した。同モデルは状態空間モデルのエンコーダーと関数基底デコーダーによって連続時間モデリングを実現し、入力のサンプリングレートや予測区間が変化した場合でも、時間スケールを動的に調整できる。IBM が公開した GIFT-Eval への提出モデルには 910 万パラメータ版が含まれており、主流の Transformer ベース TSFM よりも大幅に小さい。

このアプローチは、異なるサンプリングレートへの適応と計算効率を重視している。現時点で、公開論文の主眼は複雑な異種多変量関係ではないため、金融シナリオで利用するには、複数資産・複数ファクターのモデリング能力と組み合わせた評価がなお必要である。

三、Falcon TST の差別化は金融シナリオでの検証によって裏付けられている

Falcon TST は、まず金融業務での検証を確立し、その後、公開モデルファミリーへと発展した。 2025 年 5 月、Ant International は Barclays と TST を用いた為替予測で協業を開始した。7 月には Citi と航空顧客向け為替リスク管理の実証実験を行い、8 月には Standard Chartered の SCALE 流動性エンジンに TST を接続した。Falcon-1.0 が Hugging Face で正式に公開されたのは、その後の 10 月である。

このことから、Falcon の発展経路は、「まず公開ベンチマークで成績を上げ、その後に業界での活用先を探す」という典型的な TSFM とは異なることが分かる。実際の資金管理と為替エクスポージャー予測は、公開された開発史の中でも早い段階から登場している。

Falcon-1.0 の中核設計は、階層型 Mixture of Experts によってマルチスケールの時間パターンを処理することにある。 Ant International の公式リポジトリでは、Falcon-1.0 を階層型 Mixture of Experts モデルと定義している。Patch 単位の専門化とサンプル単位の階層ルーティングにより、異なる時間スケールを処理する。

現在、Falcon の公式サイトでは、製品仕様として 3,000 億の時点と 25 億パラメータが示されている。一方、2025 年に複数の銀行と発表した共同発表では、「20 億パラメータ弱」と表現されることが多い。この 2 つの数字は、異なるモデル段階または集計基準に対応している可能性が高い。公開資料には完全な比較情報がないため、本稿ではパラメータ規模を Falcon の優位性を示す中心的な証拠とはしない。より信頼性の高い公開情報は、時間単位、日次、週次など複数の時間スケールにおけるキャッシュフローおよび為替エクスポージャーの業務予測能力である。

四、Falcon-2.0 と Falcon-X は、それぞれ単変量効率と多変量関係モデリングを強化

Falcon-2.0 は、単変量予測の効率と確率出力に重点を移した。 Ant International は 2026 年 7 月、Falcon-2.0 API を公開した。公式には、ORBIT 学習フレームワークに基づく Encoder-Only の単変量 TSFM と定義されている。

初代の階層型 Mixture of Experts アーキテクチャと比べ、Encoder-Only は 1 回のフォワード計算で予測を完了しやすく、自動回帰的な逐次生成に伴う遅延と誤差の累積を抑えられる。公開 API は、0.01、0.05、0.10 から 0.95、0.99 まで、合計 21 個の分位点を直接出力できる。また、input_mask によって欠損値を明示的に指定できるため、祝日、取引停止、営業日と取引日のずれなどが存在する金融データにも、より適切に対応できる。

Falcon-X は、金融シナリオで最も重要な異種多変量モデリング能力を補完した。 Ant International のチームは 2026 年 5 月 26 日、Falcon-X の論文を公開した。公開された実験モデルの最大規模は 591M パラメータである。Falcon-X は物理的意味の異なる変数を統一された潜在空間表現へ変換し、差分アテンションによって正の相関と負の相関を同時に識別したうえで、変数間の関係を処理し、各変数の軌跡を再構築する。

論文では、GIFT-Eval において 0.687 の MASE を報告し、fev-bench で多変量評価も行っている。金融業務にとってより重要なのは、モデルが「為替レート—金利—ボラティリティ—商品」といった異種変数間の関係を直接処理し始めた点である。単一系列自身の過去情報だけに依存するものではない。

多変量入力は、変数間の関係が実際に有効な場合にのみ改善をもたらす。 Santa Clara University の研究者は 2026 年 5 月、Chronos-2 を用いて、「米国株式のテクノロジー大手」と米国国債金利を対象に、2000 年から 2025 年までローリング予測を行った。研究では、関連変数を組み合わせた入力は全体として単変量入力を上回った一方、株式と金利の 2 つのパネルを直接混在させると、予測精度がかえって低下した。

この結果は Falcon-X にも示唆を与える。共有潜在空間によって情報源を拡大できる一方、金融の本番環境では、変数選択、情報の時点、ローリング・バックテストを厳格に管理し、無関係なファクターによってノイズがモデルに入り込むことを防ぐ必要がある。

分位点予測はリスク管理プロセスに組み込めるが、規制上の意味での VaR や ES と直接同一視することはできない。 Falcon-2.0 と Falcon-X はいずれも複数の分位点を出力でき、悲観・中立・楽観シナリオの構築に利用できるほか、バリュー・アット・リスクや期待ショートフォールのモデルにおける重要な入力としても利用できる。

予測対象そのものが資産収益率やポートフォリオ損益であれば、低位の分位点をテール損失の推定に利用できる。しかし実際のリスク管理体制では、カバレッジ検定、条件付きカバレッジ検定、ストレスシナリオ、モデルリスク管理を経て初めて、分位点が安定した較正能力を備えているかを判断できる。API が 1% や 5% の分位点を出力できるという事実だけから、モデルが VaR や ES の要件を満たしていると結論付けることはできない。

五、金融機関との協業により、予測能力が実際の資金管理プロセスへ組み込まれ始めた

Barclays との協業は、Falcon を銀行の為替ヘッジプラットフォームへ導入できる可能性を検証した。 2025 年 5 月 7 日、Ant International は、Barclays が TST モデルを BARX NetFX 為替ヘッジプラットフォームに接続し、Ant International の為替エクスポージャー予測の精度向上に活用すると発表した。

公開資料によると、TST は時間単位、日次、週次でキャッシュフローと為替エクスポージャーを予測でき、Ant International 自身のシナリオでは予測精度が 90% を超えている。協業の中核的な価値は、より正確なエクスポージャー予測によって不要なヘッジや銀行のリスクプレミアムを削減し、その後のリスク管理を銀行既存の Guaranteed FX プロセスで実行することにある。

Citibank との実証実験では、航空顧客のオンライン航空券販売における為替リスク管理に Falcon を活用した。 2025 年 7 月 18 日、Citibank と Ant International は共同実証実験を発表し、Falcon TST と Citibank の固定為替レートソリューション(Citi Fixed FX Rates)を組み合わせ、複数通貨にまたがるオンライン販売を行う航空会社を対象とした。

Citibank の公式発表によると、最初の航空顧客は実際の取引においてヘッジコストを削減した。また、Ant International のデータとして、実証顧客のヘッジコストが約 30% 削減されたと説明している。この協業は、時系列基盤モデルが「予測 as a Service」という形で銀行のプロダクトに組み込まれ始めたことを示している。最終的なプライシングと取引は、引き続き Citibank の既存為替システムが実行する。

Standard Chartered との協業では、Falcon を 24 時間体制の為替流動性管理プロセスに接続した。 2025 年 8 月 25 日、Standard Chartered と Ant International は、Falcon TST を同行の SCALE 集約流動性エンジンに接続し、リアルタイムかつ 24 時間の為替エクスポージャー予測を実現すると発表した。

Standard Chartered の発表によると、統合後の Ant International の為替エクスポージャー予測精度は 90% を超え、Falcon は当時、Ant International における為替変換を伴う取引の 60% 以上をカバーしていた。また、関連する為替コストは最大 60%、流動性管理コストは最大 50% 削減されたという。これらのコスト削減データは協業当事者が公表した業務上の指標であり、公開学術ベンチマークと直接比較するよりも、商用導入の成果として捉えるのが適切である。

Capital A は、現時点で比較的明確な第三者企業顧客の効果データを提供している。 2025 年 10 月 7 日、Capital A 傘下の AirAsia は公式プレスリリースで、Falcon を複数通貨のキャッシュフローおよび為替エクスポージャー予測に活用した結果、時間単位、日次、週次で算出した予測精度が 90% に達し、為替ヘッジコストが最大 40% 削減されたと発表した。

Capital A によると、このプロジェクトは Falcon の初の商用導入であり、航空業界向けのバージョンには旅行業界に関連するデータが追加されている。この事例は、業界特化の実際の価値が、単一の基盤モデルによる既存 Treasury 体系の置き換えではなく、モデル、業界データ、銀行の取引インフラ、企業の資金管理ルールを組み合わせることで生まれることを示している。

六、汎用ベンチマークでの首位は、金融業務での優位性と直接同一視できない

GIFT-Eval は依然として TSFM の汎用能力を観察する重要な窓口だが、ランキング結果は時期とデータ重複の状況を踏まえて解釈する必要がある。 Salesforce が GIFT-Eval を構築した目的は、ゼロショットテストを統一し、データ漏洩を減らすとともに、異なる周波数や変数数を持つモデルを比較することにあった。2026 年以降、Falcon-X、Falcon-2.0、FlowState の新バージョン、さらに複数の Agent モデルが継続的に加わり、ランキングは頻繁に変動している。

後続の一部論文では、「GIFT の学習データと重複している可能性がある」Chronos-2 の結果と、より厳格なデータ漏洩のないバージョンを明確に区別している。金融機関にとって、ある時点の「世界一」を固定的に引用することは、容易に実態と乖離する。より重要なのは、自社の資産、周波数、市場局面、バックテスト期間において、モデルが安定性を維持できるかを検証することである。

現時点では、金融タスクにおいて絶対的な優位性を確立した技術路線は存在しない。 Chronos-2 は関連変数や共変量をコンテキストとして取り込むことに長けている。TimesFM 2.5 は長いコンテキストと成熟したエコシステムを基盤に、強力なプラグアンドプレイ性能を維持している。Moirai 2.0 は、小型モデルでも汎用ベンチマークで競争力を保てることを示した。FlowState は異なるサンプリングレートへの適応を重視し、Falcon-2.0 と Falcon-X は、それぞれ高効率な単変量予測と異種多変量関係モデリングに注力している。

金融タスクでは、極端な相場、時間の整合、外生変数、分位点の較正、デプロイ時の遅延に対する要件がそれぞれ異なる。そのため、モデルの選択は具体的な業務目標から逆算して行う必要がある。

表 1 主流時系列基盤モデルの公開技術路線と金融応用に関する考察

モデル公開バージョンと規模中核技術路線多変量および外生情報金融応用に関する考察
Falcon TST 2.0Falcon-2.0 の最大実験モデルは 585M、Falcon-X の最大公開実験モデルは 591MFalcon-2.0 は Encoder-Only + ORBIT、Falcon-X は共有潜在プロトタイプ空間を採用Falcon-X は異種多変量をネイティブにサポート。両モデルとも分位点予測 API を提供為替および Treasury シナリオで検証済み。Falcon-2.0 の完全な論文は未公開
Amazon Chronos-2120MEncoder ベースの Group Attention とコンテキスト学習単変量、多変量、共変量条件付き予測をネイティブにサポート独立した金融研究では、関連変数の組み合わせが有効であることを確認。無関係なクロスマーケット変数はノイズを導入する可能性がある
Google TimesFM 2.5200M、オプションで 30M の分位点ヘッドDecoder-Only、最大 16k コンテキストをサポートネイティブでは単変量が中心。XReg により共変量を追加可能金融ベンチマークで平均的に高い性能を示すが、一部の資産ではローカルな教師ありモデルを下回る
Salesforce Moirai 2.0Small 版は約 11.4MDecoder-Only、分位点損失と多 Token 予測を採用Moirai ファミリーは汎用的な多系列予測を対象とし、2.0 では欠損値とロバスト性への対応を強化汎用的な効率性に優れる。公開されている学習コーパスは金融専用ではない
IBM FlowStateGIFT-Eval の公開提出モデルに 9.1M 版を含む状態空間モデルのエンコーダー + 関数基底デコーダー異なるサンプリングレートと可変予測区間の問題解決を重視異なる周波数をまたぐタスクに適している。複雑な異種多変量関係については追加検証が必要

データソース:各モデルの公式論文、技術ブログ、GIFT-Eval 公開資料

注:GIFT-Eval は動的ランキングであり、一部の提出には学習データの重複を示すフラグが付いている。時点ごとのランキングを長期的な結論として固定化しないため、表には統一的な「現在の順位」を記載していない。

七、金融 TSFM の競争は、データ適合、リスク較正、エンジニアリング実装に左右される

金融 TSFM の次の競争段階では、「ゼロショット予測が可能か」から「実際のリスク管理プロセスで安定して利用できるか」へと重点が移る。 汎用モデルは、大規模な分野横断型事前学習によって時系列モデリングの参入障壁を大幅に下げられることを示した。一方、金融分野の実証研究は、ドメインデータとタスク適応が依然として重要であることを繰り返し示している。

資金管理、流動性予測、為替エクスポージャーなどのシナリオでは、モデル評価の中心的な基準は、ローリング・バックテストの安定性、極端な相場での破綻限界、分位点の較正、データ漏洩の制御、推論コスト、システム接続能力へと移行すべきである。汎用ベンチマークには依然として価値があるが、それだけで答えられるのはモデルが「予測できるか」であり、「リスク管理体制に組み込めるか」ではない。

Falcon TST 2.0 は、金融応用に向けた比較的明確な道筋をすでに形成している。 2025 年の主軸は、TST モデルを Barclays、Citi、Standard Chartered、Capital A などの機関における実際の資金管理・為替業務へ組み込むことだった。2026 年の主軸は、Falcon-2.0 と Falcon-X によって、それぞれ高効率な単変量予測と異種多変量予測の課題を解決することにある。

公開されている証拠からは、このアプローチが金融プロダクト化に向けた強固な基盤を備えていることが分かる。今後は、Falcon-2.0 の完全な論文、事前学習データの構成、再現可能な評価、極端な市場環境におけるストレステストなどの情報を補完する必要がある。そうすることで初めて、その優位性が持続可能かどうかをさらに検証できる。

時系列基盤モデルは、「汎用基盤と業界特化モデルが併存する」市場構造を形成しつつある。 TimesFM や Chronos などの汎用 TSFM は、低コストの実験、コールドスタート、業界をまたいだ迅速な移行に適している。一方、金融特化モデルは、データが豊富で、指標が明確かつリスク感応度の高い本番シナリオに適している。

Falcon TST 2.0 の意義は、競争の焦点を実際の金融プロセスへさらに移した点にある。モデルは時間的規則性、変数間の関係、不確実性を理解するだけでなく、銀行や企業が既に運用しているリスク管理、ヘッジ、流動性管理の体系に組み込まれなければならない。金融機関が最終的に購入するのは、検証、較正、ガバナンスが可能で、継続的に業務価値を生み出す予測能力の一式であり、モデル規模はその中の 1 つの技術指標に過ぎない。

八、主な資料 स्रोत

  1. Salesforce AI Research, GIFT-Eval: A Benchmark for General Time Series Forecasting Model Evaluation, 2024-11-12。

  2. Amazon Science / GitHub, Chronos-2: From Univariate to Universal Forecasting / Chronos repository, 2025-10-20。

  3. Google Research / GitHub, TimesFM 2.5 release and 2026 updates, 2025-09-15—2026-04-09。

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/479631.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →