科研速览 · Science Skim继续刷下去 · Keep skimming →
◇ California Digital Library2026-07-31· Computer science

Multimodal Reasoning and Agentic Learning for Vision-Language Models

Kaixuan Fan

原始摘要(英文原文)· Original abstract
This doctoral research investigates multimodal foundation models, visual reasoning, and agentic reinforcement learning. The research involves the use of public datasets, synthetically generated training data, model interaction trajectories, experimental configurations, evaluation outputs, and machine learning model checkpoints.
读原文 · Read the paper ↗

AI 追问PRO

登录后使用 AI 追问

讨论区

登录后参与讨论

相关论文 · Related

Multimodal Reasoning and Agentic Learning for Vision-Language Models — 科研速览 Science Skim