VQ-VA World: Towards High-Quality Visual Question-Visual Answering
VQ-VA世界:迈向高质量的视觉问题-视觉回答
专题命中 推理评测 :reasoning(abstract)
AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
VQ-VA世界:迈向高质量的视觉问题-视觉回答
专题命中 推理评测 :reasoning(abstract)
AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。
构建浏览器代理:架构、安全与实用解决方案
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出通过专用工具和编程约束构建安全浏览器代理,实现85%的成功率。
Comments 30 pages, 22 figures. Production architecture and benchmark evaluation of browser agents
CoT红手:链式推理监控的压力测试
机构 * LASR Labs(语言与语音研究实验室)
专题命中 其他推理 :chain-of-thought(title,abstract);CoT(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种混合协议,通过结合模型推理和行动评分,提升链式推理监控在检测有害行为方面的性能。
Comments To be published in the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
先思后定(ThiFAN-VQA):一种用于灾后损害评估的两阶段链式思考框架
专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 ThiFAN-VQA通过两阶段推理框架提升灾后损害评估的准确性与可解释性。
SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。
Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)
如何找到非凡的AI论文:自我排名作为预测科学影响的强大指标超越同行评审
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Yale University(耶鲁大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; New York University(纽约大学) ; Princeton University(普林斯顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过研究作者自我排名发现其能有效预测AI领域高影响力论文,优于同行评审。
LLMs能否在低资源语言中忠实解释自己?一种波斯语情感检测的案例研究
机构 * School of Electrical and Computer Engineering College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,德黑兰大学) ; Computer Science Department, University of British Columbia, Vancouver, Canada(计算机科学系,不列颠哥伦比亚大学) ; Tehran Institute for Advanced Studies, Khatam University, Tehran, Iran(德黑兰高级研究学院,卡坦大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究评估了LLMs在低资源语言波斯语情感分类中的解释忠实性,发现模型生成的解释与人类判断不一致,强调了改进解释方法的必要性。
通过稀疏自编码器的可解释奖励模型
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 SARM通过整合预训练稀疏自编码器,提升奖励模型的可解释性和对齐性能。
Comments AAAI 2026 Oral
迈向多模态图大规模语言模型
机构 * Department of Computer Science and Technology(计算机科学与技术系) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出多模态图大规模语言模型(MG-LLM),旨在统一和泛化多模态图数据和任务,通过统一空间、多任务处理、上下文学习等五个核心特性,推动多模态图学习的发展。
Comments 4 figures, 2 tables
Journal ref Science China Information Sciences (2025)
Viper-F1:基于交叉模态状态空间调制的高效细粒度多模态理解
专题命中 其他推理 :reasoning(abstract)
AI总结 Viper-F1通过引入高效液态状态空间动力学和令牌-网格相关模块,实现了高效细粒度多模态理解。
Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission
基于动态知识图谱构建的自适应候选检索用于冷启动推荐
专题命中 其他推理 :reasoning(abstract)
AI总结 ColdRAG通过动态构建知识图谱和LLM引导的多跳推理,提升冷启动推荐性能。
Comments 10 pages