Qwen3をファインチューニングした金融特化AIが、GPTやClaudeを超えた——BridgewaterとMira Murati新会社の共同実験
世界最大級のヘッジファンドBridgewaterとMira Murati率いるThinking Machines Labが、オープンウェイトモデルQwen3-235Bをファインチューニングし、金融文書の評価タスクでフロンティアモデルを上回る精度84.7%と、約14分の1のコストを実現したと発表しました。
世界最大級のヘッジファンドBridgewaterとMira Murati率いるThinking Machines Labが、オープンウェイトモデルQwen3-235Bをファインチューニングし、金融文書の評価タスクでフロンティアモデルを上回る精度84.7%と、約14分の1のコストを実現したと発表しました。
Ahead of AIが、訓練済みLLMの評価手法を「多肢選択・検証器・リーダーボード・LLM審判」の4つに整理し、Qwen3 0.6Bを使ったMMLU評価のPyTorch実装例を公開しました。約1.5GBのRAMで動く軽量構成で、自社モデル選定の判断材料として注目に値します。
Apache 2.0ライセンスで公開されているQwen3は、235B-Instruct版がLMArenaで8位、Claude Opus 4と同順位に並ぶ実力派です。PyTorchによるフルスクラッチ実装を解説した「Ahead of AI」の記事を起点に、その存在感と事業活用の現実を整理します。
Ahead of AIが2025年1〜6月のLLM研究論文をトピック別に整理した読書リストを公開しました。Kimi k1.5、DeepSeek-R1、Qwen3、Magistralなど主要モデルから、検証可能な報酬による強化学習(RLVR)、推論時スケーリングまで、3カテゴリで全体像を俯瞰できます。