Reaching Agreement Among Reasoning LLM Agents
使推理LLM代理达成一致
专题命中 推理评测 :reasoning(title,abstract)
AI总结 Aegean通过引入基于共识的协议,为多代理推理提供正式模型,有效减少延迟并保持答案质量。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
使推理LLM代理达成一致
专题命中 推理评测 :reasoning(title,abstract)
AI总结 Aegean通过引入基于共识的协议,为多代理推理提供正式模型,有效减少延迟并保持答案质量。
VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?
机构 * 1 Institute of Automation, Chinese Academy of Sciences ; 2 School of Artificial Intelligence, University of Chinese Academy of Sciences ; 3 Centre for Artificial Intelligence ; Robotics, Hong Kong Institute of Science \& Innovation, CAS ; 4 Independent Researcher
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。
S$^3$IT:一种用于空间情境社交智能测试的基准
机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。
Comments 10 pages, 9 figures
SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进
机构 * Xi’an Jiaotong University(西安交通大学) ; China Telecom Shaanxi Branch(中国电信陕西分支)
专题命中 推理评测 :reasoning(abstract)
AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。
面向跨分辨率土地覆盖制图的双分支局部-全局框架
机构 * Guangzhou Institute of Technology(广州科技研究院) ; Xidian University(西安电子科技大学) ; School of Computer Science and Technology(计算机科学与技术学院) ; University of California(加州大学) ; Department of Mathematics(数学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 DDTM通过双分支框架解耦局部语义细化与全局上下文推理,提升跨分辨率土地覆盖制图的精度与鲁棒性。
远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。
更少的幻觉,更多的验证:一种基于LLM的三阶段框架用于语音识别错误纠正
机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) ; MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能联合实验室、AI研究院、X-LANCE实验室、上海交通大学) ; AISpeech Ltd, Suzhou, China(上海苏州AISpeech有限公司)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出一种基于LLM的三阶段框架,用于减少语音识别错误纠正中的幻觉问题,通过预检测、链式思维修正和推理验证提高纠正准确性。
Comments This paper has been ACCEPTED for publication in ASRU
基于大视觉-语言模型的异常思维链
机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学与技术学院) ; NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内尔大学) ; DeepNeuronic
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出CoAT框架,通过引入异常偏见提升大视觉-语言模型在异常检测和分类任务中的性能。
Comments 2 pages, 3 figures, 1 table. Accepted for RECPAD 2025
SynCraft: 引导大语言模型预测编辑序列以优化分子合成可行性
机构 * BNLMS, College of Chemistry and Molecular Engineering, Peking University, Beijing 100871, China(BNLMS,化学与分子工程学院,北京大学,北京100871,中国)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 SynCraft通过引导大语言模型预测编辑序列,优化分子合成可行性,提升生成分子的结构保真度和合成可行性。
Comments 28 pages, 4 figures, 1 table
用于人体活动识别的设备端大多模态智能体
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出了一种用于人体活动识别的设备端大多模态智能体,结合大语言模型提升性能与可解释性,实现高分类准确率和用户友好交互。
GR-RL:为长周期机械操作实现灵活与精确
机构 * ByteDance(字节跳动)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 GR-RL通过多阶段训练管道,将通用VLA策略转化为擅长长周期精确操作的专家策略,成功实现自主系鞋带任务。