arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 64 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 64 篇

2608.26182 2026-08-28 cs.AI cs.HC cs.RO 新提交 93%

Why did My Robot Just Change Personality? Prompting Guidelines for a Grounded Robot Persona in LLM-Based HRI

我的机器人为什么刚改变了人格?面向基于大语言模型(LLM)的人机交互(HRI)的具身机器人人格提示设计指南

Ashita Ashok, Franziska Babel, Patrick Holthaus, Rucha Khot, Karla Bransky, Fethiye Irmak Dogan, Karsten Berns, Silvia Rossi, Minha Lee, Guy Laban

机构 * RPTU Kaiserslautern(凯泽斯劳滕工业大学) Linköping University(林雪平大学) University of Hertfordshire(赫特福德大学) Eindhoven University of Technology(埃因霍温理工大学) Australian National University(澳大利亚国立大学) University of Cambridge(剑桥大学) University of Naples Federico II(那不勒斯费德里科二世大学) Ben-Gurion University of the Negev(本-古里安大学内盖夫分校) The Azrieli National Center for Autism and Neurodevelopment Research(阿兹列利国家自闭症与神经发育研究中心)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文针对基于LLM的HRI中机器人人格模糊等问题,提出含八个组件的提示设计框架及指南,为HRI研究提供结构化设计与报告辅助,强调提示设计需作为社会技术问题处理。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26291 2026-08-28 cs.AI q-bio.NC 新提交 92%

Assessing mentalization in humans and large language models

评估人类与大型语言模型的心智化能力

Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang

机构 * University of Birmingham(伯明翰大学) Virginia Tech(弗吉尼亚理工大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究以两项经济博弈结合认知计算建模,对比测试DeepSeek等四款LLM智能体与人类参与者,发现不同LLM心智化能力有差异,GPT-5表现优于人类,证实认知计算建模可用于评估人机比较智能。

Comments 46 pages, 4 figures, 2 tables. Supplementary information available on request from the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26161 2026-08-28 cs.CL cs.AI 新提交 91%

Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models

基于双种子比较的互去偏方法用于大语言模型的概率采样

Zihao Guo, Hongtao Lv, Chaoli Zhang, Laiguo Yin, Lei Liu, Yonghui Xu, Lizhen Cui

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究针对大语言模型概率采样的系统性偏差问题,提出双种子比较(DSC)协议,通过两个独立种子中和偏差,在多数评估设置中性能优于现有方法,还可适配多项选择问题生成等任务以提升分布控制能力。

Comments 28 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27046 2026-08-28 cs.LG cs.AI cs.DC cs.PF 新提交 91%

Performance Foundations of Parallel & Distributed Reasoning Language Models

并行与分布式推理语言模型的性能基础

Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 该研究针对RL-for-LLM范式,分析主流后训练算法框架,构建RLM并行策略分类体系,提炼实用指南并概述开放方向,以推动开发高性能可扩展的高性价比RLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26114 2026-08-28 cs.AI cs.CL q-fin.CP 新提交 90%

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

CIFQA:一种用于金融查询问答的确定性工具基多智能体大语言模型框架

Kunjesh Parekh, Anil Kumar Tiwari, Divya Saxena

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM多步骤金融计算易出错的问题,提出CIFQA多智能体框架,在定期存款查询基准上准确率达95.54%,且17B开源模型在该框架内表现优于更大前沿模型,证明架构设计对数值可靠性更关键。

Comments 16 pages, 5 figures, submitted for academic dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23780 2026-08-28 cs.CL cs.AI cs.HC 版本更新 90%

When Youth Enter The Chat: An Epistemic Shift in the Validation of LLM-Based Measures of Student Talk

当青少年参与对话:基于大语言模型(LLM)的学生话语测量验证中的认知转变

Liliana Santos-Deonizio, James Malamut, Ramón Antonio Martínez, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究针对基于LLM的学生话语测量的认知排斥问题,通过多民族志方法让青少年参与研究,发现学生解读与LLM测量存在不一致,凸显青少年参与认知过程的必要性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26990 2026-08-28 cs.AI cs.MA 新提交 90%

DSA: Evidence-Aware LLM-Agent Orchestration for Multi-Market Stock Research

DSA:面向多市场股票研究的证据感知大语言模型智能体编排框架

Linsen Zhu, Yi Shi

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出DSA框架,基于LLM智能体实现多市场股票研究的证据感知编排,通过工作流组织、配置文件差异化处理及测试验证,确保系统实现一致性。

Comments 6 pages, 2 figures, 3 tables. Code available at this https URL (https://github.com/ZhuLinsen/daily_stock_analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26332 2026-08-28 cs.LG 新提交 90%

Beyond Capability Benchmarks: Learning Operational Fingerprints of LLM Cloud Services from Production Incident Metadata

超越能力基准:从生产事件元数据学习LLM云服务的操作指纹

Meiwei Zhang, Eduardo Miranda, Bruce Baynes, Suvigya Jain, Wanlong Chen, Tao He, Sergey Borodavkin

机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26166 2026-08-28 cs.HC cs.AI 新提交 90%

Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning

以用户为中心的思维链推理提升大语言模型可解释性

Philipp Schröppel

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出以人为本的LLM推理轨迹构建方法,采用类XML标签编码,在保持数学推理性能的同时提升可解释性,显著改善用户感知的有用性与易用性,助力高风险AI部署的人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27234 2026-08-28 cs.CR cs.SE 新提交 89%

SPA: Securing Persistent LLM Agents Across Queries with Plan-First Information-Flow Control

SPA:通过优先计划的信息流控制保护跨查询的持久化大语言模型智能体

Dylan Girrens, Guangjing Wang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SPA是一种优先计划的架构,通过双格信息流控制保护LLM智能体的规划、执行与跨查询状态复用,在AgentDojo和AgentDojo-MQ上可显著降低攻击成功率,同时揭示了安全与效用的权衡。

Comments Submitted to USENIX Security 2027. 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26187 2026-08-28 cs.CL cs.AI cs.LG cs.LO 新提交 89%

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

当规范补全出错时:大型语言模型中跃迁的形式化与测量

Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对大型语言模型的“跃迁”进行形式化定义与测量,发现模型在第二步会放弃默认补全完成跃迁,更高难度失败源于推理预算或约束问题,而非回归默认,为相关争论提供了新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26832 2026-08-28 cs.CL 新提交 88%

RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models

RuleWeaver:面向大型语言模型的以规则为中心的场景推理基准测试

Bohan Yu, Shi-Yang Li, Pengfei Cao, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有基准测试无法全面评估大型语言模型以规则为中心的场景推理能力的问题,本文提出RuleWeaver基准测试框架,通过构建规则化问答实例并开展过程级评估,发现当前主流LLMs在该任务上表现不佳。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26147 2026-08-28 cs.CL cs.CV 新提交 88%

CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models

CARE:面向医学大语言模型的因果对齐推理探索

Yucheng Zhou, Peng Luo, Qianning Wang, Chengzhong Xu, Jianbing Shen

机构 * University of Macau(澳门大学) Auckland University of Technology(奥克兰理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究针对医学大语言模型的推理缺陷,提出CARE框架,通过因果充分性与近端可学习性条件筛选训练经验,在医学基准上提升了推理一致性与训练稳定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26870 2026-08-28 cs.AI cs.CL cs.SI 新提交 88%

C-Unseen: Weak Signal Detection in Dynamic Temporal Knowledge Graphs via LLM Reasoning

C-Unseen:基于大语言模型推理的动态时序知识图谱中的弱信号检测

Yassir Lairgi, Ludovic Moncla, Khalid Benabdeslem, Rémy Cazabet, Pierre Cléau

机构 * INSA Lyon(里昂国立应用科学学院) CNRS(法国国家科学研究中心) UCBL(里昂第一大学) GAUC

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出C-Unseen框架,通过LLM的思维链推理识别动态时序知识图谱中与主导叙事有张力的罕见子图并追踪其持续性,实现弱信号检测,性能优于各类基线方法。

Comments Accepted at the AI4SE 2026 Special Track, held within the WISE 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-08-28 cs.CR cs.AI 新提交 87%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09215 2026-08-28 cs.CL eess.AS 版本更新 87%

SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models

SPAR-K:调度周期性交替早退用于语音语言模型

Hsiao-Ying Huang, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 推理与问题求解 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL

AI总结 SPAR-K通过调度周期性交替早退机制,提升语音语言模型的推理效率,同时保持感知质量,减少解码深度并优化性能。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-08-28 cs.AI cs.CL 版本更新 86%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15740 2026-08-28 cs.FL cs.AI cs.SE 版本更新 85%

HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement

HybridProver:结合大语言模型驱动的证明合成与精化增强定理证明

Jilin Hu, Jianyu Zhang, Yongwang Zhao, Talia Ringer

机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) Siebel Center for Computer Science University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学中心)

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HybridProver框架,以证明草图为中间表示集成两种定理证明范式,在miniF2F Isabelle基准上使7B模型成功率达73.8%,优于此前最优水平。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27142 2026-08-28 cs.AI 新提交 84%

GRAIN: Bridging Name and Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RL

GRAIN:通过不变性奖励的智能体强化学习弥合真实世界图推理中的名称与叙事变化

Zike Yuan, Han Zhang, Jianzhi Yan, Le Liu, Cai Ke, Huozhi Zhou, Jian Xie, Jiran Yin, Yukun Cao, Yue Yu, Hui Wang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对LLMs在真实世界图推理中对节点标识符与任务表述变化脆弱的问题,提出基于强化学习的单智能体框架GRAIN,结合结构不变性奖励提升鲁棒性,在准确率、延迟及分布外泛化性上优于多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26867 2026-08-28 cs.AI 新提交 83%

BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click

BekchiAI:一键式测量、观测与控制大语言模型智能体

Mesut Toruk

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BekchiAI是一款兼具智能体技能测量基准与实时观测控制平台的工具,含2057个测试任务的基准及配套平台,已公开发布并完成多模型对比。

Comments 8 pages, 1 Figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-28 cs.CL 版本更新 83%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-28 cs.CL 版本更新 83%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26386 2026-08-28 cs.CL cs.AI cs.LG 新提交 82%

Co-Evolving Structured Knowledge and Reasoning in Language Models

语言模型中结构化知识与推理的协同演化

Ryan Thomas Noonan, Linxi Zhao, Menghan Xu, Akanksha Sarkar, Mihir Mishra, Dongyoung Go, Kilian Q. Weinberger, Yoav Artzi, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对检索增强方法的局限,提出协同演化框架KBevo,联合学习构建结构化知识库与推理,提升了知识结构质量、答案可达性及推理与可控性。

Comments COLM2026. Code available at this https URL (https://github.com/kilian-group/KBevo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27225 2026-08-28 cs.RO cs.AI 新提交 81%

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

STEP:基于多模态大语言模型的状态感知任务估计与规划,用于人机协作

Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Honda Research Institute(本田研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型用于人机协作任务规划时的状态理解缺失问题,提出STEP方法,在机器人装配模拟任务中使动作可执行性提升32.8%、最终状态误差降低14.8%。

Comments Published in IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2026, 8 pages, 4 figuers, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27036 2026-08-28 cs.CL 新提交 81%

Reasoning about In-Context Samples for Machine-Translation

针对机器翻译的上下文示例推理

Maxime Bouthors, Josep Crego, François Yvon

机构 * SYSTRAN by ChapsVision Sorbonne Université(索邦大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出基于片段的推理框架,结合Qwen3模型家族在6种语言(每语言最多5领域)的实验,验证其机器翻译性能优于标准k-shot等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26329 2026-08-28 cs.CL 新提交 81%

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification

神经符号PRM:通过结构化轨迹与符号验证增强科学推理

Yuxin Zi, Cong Xu, Suparna Bhattacharya, Martin Foltin, Amit Sheth

机构 * AI Institute of South Carolina(南卡罗来纳州人工智能研究所) HPE Labs(慧与实验室) Indian AI Research Organisation(印度人工智能研究组织)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出神经符号PRM框架,解耦推理为符号有效性与语义接地性,引入反事实符号扰动训练PRM,通过验证器优先搜索提升工具增强型LLM的科学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-28 cs.CL 版本更新 81%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25160 2026-08-28 cs.CV cs.AI cs.CL 版本更新 81%

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

GSM8K-V:视觉语言模型能否在视觉语境下解决小学级数学应用题

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了多图像视觉数学基准GSM8K-V,评估34个VLMs发现其存在显著模态差距,最优模型仅达59%准确率,瓶颈为隐式视觉推理错误,且视觉数学优化模型在此无提升。

Comments 59 pages, 7 figures, Project Page: this https URL (https://zju-real.github.io/GSM8K-V) Code: this https URL (https://github.com/ZJU-REAL/GSM8K-V) Datasets: this https URL (https://huggingface.co/datasets/ZJU-REAL/GSM8K-V) Accepted at EMNLP 2026 Main Conference. Updated to the camera-ready version with additional experiments, analyses, and revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 80%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-08-28 cs.CL 版本更新 79%

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏