arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-26 至 2026-08-26 共收录 134 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 18 篇

2604.01597 2026-08-26 cs.LG 版本更新 77%

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

从正确的回放中学习:基于PPO的LLM后训练的数据归因

Dong Shu, Denghui Zhang, Jessica Hullman

机构 * Northwestern University(西北大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出Influence-Guided PPO框架,通过计算影响分数筛选反向齐梯度的回放片段,提升PPO后训练效率并减少不忠实的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21296 2026-08-26 cs.MA 版本更新 75%

Level-k Distinguishable Mechanisms for Evaluating Bounded Rationality in LLMs

用于评估大型语言模型(LLMs)有限理性的k级可区分机制

Binchi Zhang, Atrisha Sarkar

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract)

AI总结 该研究提出k级可区分机制,通过新型博弈结构评估LLMs的策略深度,发现递归推理下模型策略深度准确,对手博弈的归纳推理会降低性能,明确策略心智化可提升表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24848 2026-08-26 cs.CL 新提交 70%

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模

Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24319 2026-08-26 cs.AI cs.LG cs.SY eess.SY 新提交 62%

Can a Dynamic Internal Field Govern a Transformer's Cognition? Certifiability, not Superiority, in Homeostatic Compute Control

动态内部场能否调控Transformer的认知?稳态计算控制中的可认证性,而非优越性

Francisco M. Arrabal-Campos, Ignacio Fernandez, Francisco G. Montoya, Alfredo Alcayde

机构 * University of Almería(阿尔梅里亚大学) Research Centre CIAIMBITAL(CIAIMBITAL研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究动态内部场能否调控Transformer认知,证明其具有可认证的运行时稳定性,虽未提升认知能力,但可作为可行的计算调控器。

Comments 22 pages, 4 figures. Companion paper: "Where Cognition Lives" (arXiv:2608.22347). Code, preregistrations and results: https://github.com/fmarrabal/miuracognitive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18699 2026-08-26 cs.CL cs.AI cs.IR 版本更新 62%

TW-LegalBench: Measuring Taiwanese Legal Understanding

TW-LegalBench: 衡量台湾法律理解

Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

机构 * University of Rochester(罗切斯特大学) National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出TW-LegalBench基准,包含多项选择、开放式问答和法律判决预测任务,评估13个LLM在台湾法律上的表现,发现顶尖模型通过律师考试但未达到法官检察官标准,且法律条文引用困难。

Comments 10 pages, 2 figures, To appear in ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24358 2026-08-26 cs.AI 新提交 57%

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

交接代价:在大语言模型智能体中延续非原生轨迹

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman

机构 * AWS, Agentic AI(亚马逊云科技智能体人工智能部门)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究聚焦大语言模型智能体的交接代价,通过对比Claude和GPT系列模型的不同交接设置,发现完整轨迹升级质量提升有限且成本高,降级更具优势,且交接接口偏好随方向反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-08-26 cs.RO cs.AI 新提交 57%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: https://worv-ai.github.io/ponderpounce/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 57%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20373 2026-08-26 cs.CL 版本更新 57%

An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study

用于评估大型语言模型在临床登记处抽象任务中性能的歧义分类:一项多中心前瞻性研究

James Matheson, Betsy Castillo, Andrew Y. Shin, David Scheinker

机构 * Carta Healthcare(卡塔医疗) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本多中心前瞻性研究评估LLM在临床登记处抽象任务中的性能,发现其准确率远低于人类抽象人员,且随问题歧义度和临床推理要求升高而降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04469 2026-08-26 cs.CL 版本更新 57%

Don't Commit Alone: Joint Token Commitment in Diffusion Language Models

不要单独提交:扩散大语言模型中的联合令牌提交

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究扩散大语言模型中多令牌提交问题,提出CoCommit方法,通过标记门控协调步骤延迟提交,重新应用骨干网络最后n层使标记位置协调,近似联合模式解码,提高推理和精确答案任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10059 2026-08-26 cs.AI 版本更新 57%

Strategic Exploitation in LLM Agent Markets: A Simulation Framework for E-Commerce Trust

LLM代理市场中的战略利用:电子商务信任的模拟框架

Shijun Lei, Quang Nguyen, Swapneel S Mehta, Zeping Li, Huichuan Fu, Xiaolong Zheng, Siki Chen, Yunji Liang, Philip Torr, Zhenfei Yin

机构 * Northwestern Polytechnical University(西北工业大学) Boston University(波士顿大学) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese Academy of Sciences(中国科学院) University of Oxford(牛津大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TruthMarketTwin模拟框架,用于研究LLM代理在电子商务市场中的行为,发现LLM代理在传统市场中会利用声誉治理的弱点,而强制执行可减少欺骗并重塑战略推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24372 2026-08-26 cs.CV 新提交 50%

Bridging Adversarial and Collaborative Learning for AI-Generated Image Quality Assessment

桥接对抗学习与协同学习的AI生成图像质量评估

Baoliang Chen, Qing Lin, Sijie Mai

机构 * South China Normal University(华南师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对AI生成图像质量评估中感知保真度与提示对齐度的交互问题,提出含对抗与协同推理通路的交互感知框架,在基准测试中达最优准确率且具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23580 2026-08-26 cs.CY 新提交 50%

Agents of ViTAL: Ethics Missions -- A Narrative-Centered Learning Environment with a Co-Designed Conversational Agent for Middle School AI Ethics

ViTAL智能体:伦理任务——面向中学生AI伦理的以叙事为中心的学习环境与协同设计的对话智能体

Sarah Burriss, Jinzhi Zhou, Namrata Srivastava, Justin Phillips, Courtney Barron, Kara Cassell, Albert Na, Megan Humburg, Tom Hu, Benjamin Yang, Corey Brady, Ole Molvig

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究开发了一款面向中学生的AI伦理学习环境,嵌入协同设计的对话智能体EthicsBot,经初步课堂验证可提升学生参与度与伦理推理能力。

Comments Accepted and presented at AIED 2026 Interactive Events (IE) Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10673 2026-08-26 cs.IR 版本更新 50%

Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation

打破以用户为中心的代理:一个三方框架用于基于代理的推荐

Yaxin Gong, Chongming Gao, Chenxiao Fan, Haoyan Liu, Wenjie Wang, Jianshan Sun, Yangyang Li, Fuli Feng, Xiangnan He

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏