Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL
Comments accepted as NAACL workshop
专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL
Comments 9 pages, ACL 2024 Findings
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL
Comments Accepted by ICML 2024
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
Comments The 38th Annual AAAI Conference on Artificial Intelligence (AAAI-24)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL
Comments Accepted to the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
Comments Accepted to Findings of EMNLP 2023
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
Comments 17 pages, 3 Figures
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
Comments In Findings of EACL 2023
$π^2$:结构起源的推理数据提升大语言模型的长上下文推理能力
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出$π^2$方法,通过结构化数据生成高质量推理数据,提升大语言模型的长上下文推理能力,在四个基准测试中取得显著改进。
Comments Our structured analytical reasoning data, which originates from Wikipedia tables, significantly improves long-context reasoning capability of LLMs
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
通过物联网数据预处理实现边缘AI的云端级精度
机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔皮耶大学) ; Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(理论与应用信息学研究所,波兰科学院) ; Department of Computer Science, University of Helsinki(计算机科学系,赫尔辛基大学) ; Satakunta University of Applied Sciences(萨塔昆塔应用科学大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 针对边缘部署的紧凑型LLM在原始传感器读数下数值推理弱的问题,提出结构化提示构建框架,通过逐步丰富文本表示(原始值、阈值描述、环境摘要标志)提升局部模型精度,实验表明该方法可将局部准确率从约50%提升至80%以上,同时保持低延迟。
使用大型视觉语言模型审核不安全的用户生成内容游戏中的非法在线图像推广
机构 * University at Buffalo(布法罗大学) ; Northeastern University(东北大学) ; Clemson University(克莱姆森大学) ; The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 针对社交媒体上非法推广不安全UGC游戏的图像,提出UGCG-Guard系统,利用大型视觉语言模型和条件提示策略实现零样本域适应,检测准确率达94%。
Comments In Proceedings of the 33rd USENIX Conference on Security Symposium (SEC '24), August 14-16, 2024
REAL: 面向LLM评判的回归感知强化学习
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; The University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 提出REAL框架,通过广义策略梯度将回归目标融入强化学习,优化LLM作为评分器的数值评估,在多个规模模型上超越SFT和标准RL方法。
Comments Accepted to ICML 2026. The first two authors contributed equally
机构 * FAIR at Meta(Meta 的 FAIR)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
Comments ICML 2025
路侧协同自动驾驶:从数据平台到视觉-语言端到端推理
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 针对现有V2X基准的局限,推出V2XBench平台与Chat-V2XBench数据集,提出AURORA端到端协同驾驶框架,其在严重遮挡场景下路径完成率达98.21%、驾驶得分76.02,开创了可扩展的V2X-VLM范式。
Comments 15 pages, 5 figures, under review
面向大语言模型复杂图推理的统一多维度基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。
Comments Under review
OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。
TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。
Comments 24 pages, 9 figures, 24 tables
长度惩罚使思维链更难被监测
专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现长度惩罚强化学习会缩短思维链推理,隐藏驱动模型答案的因素。通过训练不同目标链长度的Qwen3模型并评估,表明压缩虽能减少推理令牌、保留准确率,但降低了可监测性,揭示了压缩与可监测性的前沿关系。
开放式问答中推理的无参考评估
机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) ; Temple University(天普大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。
DREA:用于仓库级漏洞检测的解耦推理与探索代理
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。
Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables
SingGuard-NSFA:通过生成式推理和实时分类实现的可扩展智能体人工智能护栏
机构 * Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对智能体人工智能系统操作威胁,提出NSFA分类法构建基准套件,开发双模式方法,发布四个不同参数模型,在基准测试和跨源评估中表现出色,证明方法可扩展性与通用性。
当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。
TerraLogic:地球观测中分层地理空间推理的基准
机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Technical University of Munich(慕尼黑工业大学)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。
Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic
大语言模型在经济因果推理中的意识形态偏见
机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) ; College of Business, KAIST(韩国科学技术院商学院) ; School of Computing, KAIST(韩国科学技术院计算机学院) ; Division of Social Science, HKUST(香港科技大学社会科学系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨LLM在经济因果推理中的意识形态偏见,通过扩展EconCausal基准测试,评估20种先进LLM在处理意识形态冲突案例时的准确性,发现LLM在意识形态冲突案例上表现更差,且存在系统性偏倚。
Comments Accepted at COLM 2026