EgoBabyVLMとは?赤ちゃん視点の映像でAIが「失敗」する理由と省エネAIへの含意
Meta・スタンフォード大・東京大学・高等師範学校の研究者が、乳幼児の頭に付けたカメラで撮った約1000時間の映像を最先端のVLM(視覚言語モデル)に学習させる「EgoBabyVLM Challenge」を発表。最新モデルはこの雑然とした実世界映像から世界を理解できず、赤ちゃんの学習効率を再現できないことが示されました。
Meta・スタンフォード大・東京大学・高等師範学校の研究者が、乳幼児の頭に付けたカメラで撮った約1000時間の映像を最先端のVLM(視覚言語モデル)に学習させる「EgoBabyVLM Challenge」を発表。最新モデルはこの雑然とした実世界映像から世界を理解できず、赤ちゃんの学習効率を再現できないことが示されました。