arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-08-25 至 2026-08-25 共收录 5
2608.22390 2026-08-25 cs.CL 新提交

SchemaGUI: A Schema-Driven Benchmark for Controllable GUI Generation Evaluation

SchemaGUI:一种用于可控图形用户界面生成评估的模式驱动基准

Jiarui Dong, Yin Cai, Zhouhong Gu, Chenmou Wu, Ci Tao, Yiran Chen, Jialing Li, Xiaoran Shi, Juntao Zhang, Zhijun Fang

机构 * Shanghai University of Engineering Science(上海工程技术大学) Fudan University(复旦大学)

AI总结 针对LLM的GUI生成评估难题,提出SchemaGUI基准,测试Qwen3.5等5种主流模型,发现几何控制、布局复杂度、思维模式对GUI生成效果的影响规律。

Comments 18 pages, 6 figures, and 7 tables. Code is available at this https URL (https://github.com/xdong2002/SchemaGUI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22323 2026-08-25 cs.CV 新提交

MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis

MedReaMM:评估大型多模态模型在专家级临床诊断综合能力上的表现

Lai Wei, Yuchao Chen, Zhenbiao Cao, Xiaojin Zhang, Zhongyu Wei, Bangting Wang, Wei Chen, Xiang Bai

机构 * The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院) Jiangsu Province Hospital(江苏省医院) Huazhong University of Science Technology(华中科技大学) Fudan University(复旦大学)

AI总结 本研究构建了多模态临床诊断基准MedReaMM,评估23个大型多模态模型的诊断综合能力,发现多数模型准确率不足50%,揭示了该领域的能力差距及相关影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22301 2026-08-25 cs.RO cs.AI 新提交

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

模仿者游戏:超越动作预测的机器人模仿能力基准测试

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) TranscEngram Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 该研究推出四级基准《模仿者游戏》及配套数据集、评估平台,发现功能替代是机器人意图层面模仿的关键障碍,微调IG-10K预训练模型可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22191 2026-08-25 cs.AI cs.SE 新提交

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22174 2026-08-25 cs.CV 新提交

When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?

统一多模态模型中视觉生成何时能助力视觉理解?

Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本研究提出VGAU-Diag评估框架,发现统一多模态模型的视觉生成仅在简单任务上助益理解,瓶颈多在理解侧,有效生成需瞄准理解瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏