目的駆動型対話とは?LLMチャットボットが多ターン会話で「迷子」になる構造的限界
MMLUやHumanEvalなどのベンチマークが飽和する一方、ChatGPTやClaudeは数ターンの会話で指示を忘れ始める。The Gradientは、長文脈100kトークン対応モデルでも約1.6kトークン(8ターン程度)で注意が散漫になることを示し、現行のRLHFが「目的を持った対話」を学習できていないと指摘しました。
MMLUやHumanEvalなどのベンチマークが飽和する一方、ChatGPTやClaudeは数ターンの会話で指示を忘れ始める。The Gradientは、長文脈100kトークン対応モデルでも約1.6kトークン(8ターン程度)で注意が散漫になることを示し、現行のRLHFが「目的を持った対話」を学習できていないと指摘しました。