arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 18 篇

2608.28018 2026-08-31 cs.CL cs.AI cs.LG 新提交 82%

Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning

双世界:基于等变性的证据型推理弃权(不执行)方法

Vy Nguyen, Ziqi Xu, Jeffrey Chan, Estrid He, Feng Xia, Renqiang Luo, Erik Cambria, Xiuzhen Zhang

机构 * RMIT University(皇家墨尔本理工大学) Jilin University(吉林大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出双世界框架,通过等变性弃权提升大语言模型知识密集型推理的可靠性,在四个基准和三个模型主干上优于基线方法,可识别答案未可靠基于证据的情况。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28402 2026-08-31 cs.AI 新提交 79%

VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings

VERA-8B:基于SEC文件的证据支撑审计风险推理模型

Menghan Liu, Elynn Chen

机构 * New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究推出端到端审计推理系统VERA-8B,统一SFT与GRPO实现证据支撑审计推理,引入弃权机制,设计AuditBridge实现原始文件到可用报告的转换,性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29150 2026-08-31 cs.AI 版本更新 79%

Flow Reasoning Models: Turning Discrete Flows Into Efficient Recurrent Reasoners

流推理模型:通过迭代自我精炼扩展推理能力

Alec Helbling, Andrey Bryutkin, Mauro Martino, Duen Horng Chau, Nima Dehmamy, Hendrik Strobelt

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出流推理模型(FRMs),利用去噪动态的稳定性作为验证器,通过测试时缩放和训练改进,高效解决数独和斑马谜题等结构化推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 78%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04690 2026-08-31 cs.IR 版本更新 78%

Multi-Source Retrieval and Reasoning for Legal Sentencing Prediction

多源检索与推理用于法律判决预测

Junjie Chen, Haitao Li, Qilei Zhang, Zhenghua Li, Ya Zhang, Quan Zhou, Cheng Luo, Yiqun Liu, Min Zhang, Yueyue Wu, Dongsheng Guo, Qingyao Ai

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出MSR²框架,通过多源检索与强化学习提升法律判决预测的准确性和可解释性。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28403 2026-08-31 cs.SE 新提交 67%

Recovering Software Architecture Intent from Historical Work Items using Generative AI: A Mixed-Methods Industry Case Study

使用生成AI从历史工作项中恢复软件架构意图:一项混合方法行业案例研究

Dominik Storck, Tobias Eisenreich, Stefan Wagner

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本研究以两个行业项目为对象,提出基于LLM的五步半自动工作流,结合混合方法验证,可从历史敏捷工作项中恢复C4架构图,生成的架构基线准确有用,能揭示架构差异与漂移,且具备实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28444 2026-08-31 cs.CL cs.LG 新提交 62%

Sliding-window beats linear attention

滑动窗口注意力优于线性注意力

Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais

机构 * Microsoft(微软公司) Applied Sciences Group (ASG)(应用科学集团(ASG))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究对比发现,带汇点的滑动窗口注意力(SWA)性能优于后训练的线性注意力模型,在长上下文推理任务中性能高2-10倍,且无需后训练、成本低,推荐用SWA替代线性注意力模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21766 2026-08-31 cs.CL cs.AI 版本更新 62%

CoFrGeNet: Continued Fraction Architectures for Language Generation

CoFrGeNet:用于语言生成的连分式架构

Amit Dhurandhar, Vijil Chenthamarakshan, Dennis Wei, Tejaswini Pedapati, Karthikeyan Natesan Ramamurthy, Rahul Nair

机构 * IBM Research(IBM研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 受连分式启发,提出CoFrGeNet架构,用新函数类替换Transformer中的多头注意力和前馈网络,在参数量减少1/2至2/3的情况下,在下游分类、问答、推理和文本理解任务上达到或超越原模型性能。

Comments Earlier version accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-08-31 cs.CL cs.AI 版本更新 62%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28497 2026-08-31 cs.SE cs.AI 新提交 57%

On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces

智能体插件的维护与协同演化:Claude Code插件市场的实证研究

Ahmed Hereiz, Yingzhe Lyu, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过对Claude Code插件市场的实证分析,揭示智能体插件的维护与协同演化规律,发现其功能驱动开发特征及新型组件耦合依赖关系。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28252 2026-08-31 cs.AI 新提交 57%

Regime-Aware Portfolio Management via Retrieval-Augmented LLM-Guided Expert Switching

基于检索增强大语言模型引导的专家切换的状态感知投资组合管理

Ahmad Asadi, Reza Safabakhsh

机构 * Amirkabur University of Technology(阿米尔卡比尔理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对非平稳金融市场,提出检索增强LLM引导的专家切换框架,经多市场实验验证其在累计收益、夏普比率上优于对比策略,为自适应投资组合管理提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28160 2026-08-31 cs.AR cs.AI cs.HC 新提交 57%

Gen-TAS: A Generative AI-Aided Hardware-Software Task Allocation Framework for FPGA-GPP Heterogeneous Systems

Gen-TAS:面向FPGA-GPP异构系统的生成式AI辅助软硬件任务分配框架

Mary Kong, Yuqin Zhao, Semih Vazgecen, Cristian Sestito, Themis Prodromakis

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Gen-TAS是一种知识增强LLM框架,结合任务图分析与RAG技术,为FPGA-GPP异构系统生成用户特定的可解释任务分配策略,在CNN、SDR工作负载实验中实现稳定的需求驱动分配,延迟导向场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27974 2026-08-31 cs.CL 新提交 57%

QUORUM: QUality-Optimized Routing Using Multiple annotators

QUORUM:基于多个标注者的质量优化路由

Antonio Purificato, Maria Sofia Bucarelli, Andrea Bacciu, Amin Mantrach, Fabrizio Silvestri

机构 * Amazon(亚马逊) Sapienza University of Rome(罗马萨皮恩扎大学) Université Côte d’Azur(蔚蓝海岸大学) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化研究所) I3S(信息、信号与智能系统实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出预算感知路由框架QUORUM,通过特征信号估计实例难度、结合多标注者结果,在固定预算下动态分配任务,提升标注质量并降低成本。

Comments 4 figures, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28182 2026-08-31 physics.soc-ph cs.CL 新提交 57%

Benchmarking large language model agent societies against human behavioural distributions

针对人类行为分布的大语言模型智能体群体基准测试

Raad Bin Tareaf

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究开发了开源工具SILICA,测试12个大语言模型智能体群体与人类行为的契合度,发现多数模型仅起始行为与人类相近,最终行为、合作模式等均存在显著差距,仅推理训练模型表现接近人类,当前硅基智能体群体仅支持探索性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28802 2026-08-31 cs.CL 版本更新 57%

Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization

人类标注变异作为稳定信号:通过跨标注者偏好优化学习标注者特定的解释行为

Beiduo Chen, Pingjun Hong, Ziyun Zhang, Benjamin Roth, Anna Korhonen, Barbara Plank

机构 * MaiNLP Center for Information and Language Processing(信息与语言处理中心) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Vienna(维也纳大学) LTL University of Cambridge(剑桥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型能否学习并复现标注者特定的标签-解释行为,提出跨标注者偏好优化(CAPO)方法,通过对比目标标注者与其他有效但非目标标注者的响应来提升模仿和归因能力。

Comments Accepted by EMNLP 2026 Main, 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27994 2026-08-31 cs.CR cs.SE 新提交 50%

Moirae: A Multimodal Agent Collaborative Framework for Dynamic Android Malware Detection

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出多模态智能体协作框架Moirae,通过融合多维度运行时证据实现动态Android恶意软件检测,在未见过的数据集上零样本准确率达90.06%,优于现有基线且抗概念漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27929 2026-08-31 cs.CV 新提交 50%

Training-Free Temporal Abstraction for General Video Understanding

用于通用视频理解的无训练时间抽象

Etienne Casanova, Sevan Brodjian, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出无训练的STITCH方法,将视频划分为语义时间块,在三个视频理解任务上表现具竞争力,为通用视频理解提供新方向。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2026-08-31 cs.CR 版本更新 50%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

GSPR:将大语言模型(LLM)安全防护措施对齐为可泛化的安全策略推理器

Haoran Li, Jingru Zeng, Yulin Chen, Huihao Jing, Wenbin Hu, Hao Peng, Haochen Shi, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 其他推理 :reasoning(abstract)

AI总结 针对现有LLM安全防护措施泛化性不足的问题,提出可泛化安全策略推理器GSPR,通过强化学习在多安全基准训练后提升安全与类别预测能力,且推理token成本更低。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏