arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-27 至 2026-08-27 共收录 141 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 9 篇

2608.25299 2026-08-27 cs.CV 新提交 50%

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

PointRL:从可验证标注证据中学习点级视觉-语言接地

Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 测试时计算 :verifier(abstract)

AI总结 PointRL是一种可验证强化学习框架,通过将异构标注证据转换为指向指令并设计多维度奖励,提升了Qwen3.5-4B等模型的点级视觉-语言接地性能,在多个基准上取得显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 14 篇

2608.18504 2026-08-27 cs.AI 版本更新 87%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-08-27 stat.ML cs.AI cs.IT cs.LG math.IT 版本更新 84%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25542 2026-08-27 cs.LG cs.CL 新提交 81%

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference

反射引导:在激活空间中解耦反射与推理以实现高效令牌推理

Jiarui Hu, Zhiyuan Wen, Xiaoyun Liu, Jiaxing Shen, Yu Yang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学院) School of Data Science, Lingnan University(岭南大学数据科学学院) Centre for Learning, Teaching and Technology, The Education University of Hong Kong(香港教育大学学习、教学与技术中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出无需训练的Reflection Steering框架,通过解耦反射与推理的激活实现高效令牌推理,可减少16.9%推理令牌,还引入参数α平衡令牌节省、准确率与生成稳定性。

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25487 2026-08-27 cs.CL cs.IR 新提交 79%

ReliableRAG: Combating Misinformation in Retrieval-Augmented Generation via Reliability-Guided Reasoning Chains

ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息

Jinpu Jiang, Xuan Wu, Wenhao Song, Bo Yang, You Zhou, Hongwei Ge, Heow Pueh Lee, Yanchun Liang, Chunguo Wu

机构 * College of Software, Jilin University(吉林大学软件学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) National University of Singapore(新加坡国立大学) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26094 2026-08-27 cs.CV cs.AI cs.ET cs.HC cs.LG 新提交 73%

MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching

MyoMechanix:基于生物力学的可组合技能活动理解与指导

Hao Yin, Paritosh Parmar, Lijun Gu, Lin Xu, Tianxiao Guo, Xiujin Liu, Tianyou Zheng, Yang Zhang, Weiwei Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) Arexeni Research and Technologies Inc.(Arexeni研究与技术公司) Beijing Sports University(北京体育大学) University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MyoMechanix多模态生态系统,构建FKG与CUBIST,建立三类任务,多模态方法提升AQA性能与可解释性,为物理AI提供生物力学基础的技能理解方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03297 2026-08-27 cs.CL cs.AI cs.LG 版本更新 67%

TTSR: Test-Time Self-Evolving via Reflection

TTSR: 测试时自我反思以提升持续推理能力

Haoyang He, Zihua Rong, Yunjia Zhao, Lan Yang, Jian Chang, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Southwestern University of Finance and Economics(西南财经大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTSR通过测试时自我反思机制,利用学生与教师角色交替,持续改进大语言模型的推理能力。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-08-27 cs.CL cs.AI 版本更新 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-08-27 cs.CL cs.LG 版本更新 62%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25871 2026-08-27 cs.LG 新提交 57%

CEDAR: Controlled and Event-Driven Demand Forecasting via Residual Decomposition

CEDAR:基于残差分解的可控事件驱动需求预测

Junjie Meng, Ranxu Zhang, Zi-an Zhang, Shujun Liu, Xiaoning Qi, Xiaozhou Xu, Yanyong Zhang, Hui Xiong, Chao Wang

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Alibaba Group(阿里巴巴集团) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有时间序列预测方法对策略不敏感、反事实分析不可靠的问题,提出基于残差分解的两阶段框架CEDAR,在阿里1688数据集上验证其可提升模拟精度并助力预算规划。

Comments 12 pages, 4 figures, 5 tables. Published in KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea. ACM, 2026, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 57%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25358 2026-08-27 cs.AI 新提交 57%

Where vs What: Decomposing Structural and Content Failures in LLM-Generated Structured Outputs

位置与内容:分解大语言模型生成结构化输出中的结构与内容失败

Yiwei Zhang, Chengke Wu, Li Wang, Jianqiang Li

机构 * Shenzhen University(深圳大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对LLM生成结构化输出的错误,提出SCD框架,发现结构保真度随复杂度下降更快,进而提出SA-RLVR方法,有效提升了JSON和表格领域的值位置准确率。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 50%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25099 2026-08-27 math.OC math.DS 新提交 50%

A Control-Theoretic Approach for Resource-Aware Consensus in Multi-Agent AI

面向多智能体AI中资源感知共识的控制论方法

James Flagg, Esteban A. Hernandez-Vargas

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究针对LLM-MAS共识性能与计算资源关联保证不足的问题,提出将集体信念动态表征为离散时间切换系统的控制论方法,构建共识-预算证书区域,实现资源感知的多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 50%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 37 篇

2511.11635 2026-08-27 cs.CY cs.AI cs.CL 版本更新 85%

EduAgentQG: Multi-Agent Personalized Mathematics Question Generation with Explicit Diversity and Objective-Aware Evaluation

EduAgentQG:具有显式多样性和目标感知评估的多智能体个性化数学问题生成

Rui Jia, Min Zhang, Fengrui Liu, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Shanghai Institute of Al for Education(上海人工智能教育研究院) The Chinese University of Hong Kong, Shenzhen School of Data Science(香港中文大学(深圳)数据科学学院)

专题命中 推理评测 :CoT(summary_cn,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有数学问题生成方法难以兼顾目标对齐与可控多样性的问题,提出多智能体框架EduAgentQG,构建专属基准并验证其在多项指标上优于COT等基线方法。

Comments Accepted to IPM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25667 2026-08-27 cs.CR cs.AI 新提交 83%

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

漏洞评估中的AI垃圾内容与幻觉:关于推理失败及可信缓解措施的综述

Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本综述针对LLMs用于漏洞评估时产生的AI垃圾内容与幻觉问题,分析其源于专家演绎推理与LLMs自回归生成的差距,提出神经符号验证等缓解方案及CVE-Bench等评估工具,为AI驱动的安全分诊系统提供路线图。

Comments Accepted to SiMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26036 2026-08-27 cs.AI cs.CL 新提交 81%

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

LLM数据智能体的追踪完整性:现实世界系统中可审计结构化推理的愿景

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对LLM数据智能体提出追踪完整性标准,结合执行契约实现,通过CAIT率实验表明需同时评估答案准确率与可审计计算,为现实系统的LLM数据智能体提供评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25177 2026-08-27 cs.SD cs.AI 新提交 79%

AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models

AudioLens:基于推理音频-语言模型的多视角语音聚类

Wenjun Huang, Qiaosong Chu, Tiger Shao, Pengfei Zhang, Yutong Song, Hanning Chen, Yezi Liu, Weiyi Wu, SungHeon Jeong, Ryozo Masukawa, Sanggeon Yun, Yang Ni, Jiang Gui, Mohsen Imani

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Dartmouth College(达特茅斯学院) Purdue University Northwest(普渡大学西北分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出音频多视角聚类任务,构建基准AudioLens-Bench,开发经推理蒸馏和偏好优化训练的AudioLens-R1模型,实验显示其在语音聚类任务中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-27 cs.CL 版本更新 79%

InternBootcamp: Boosting LLM Reasoning with Verifiable Task Scaling

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Peiji Li, Jiasheng Ye, Yongkang Chen, Linyang Li, Yichuan Ma, Zijie Yu, Ganqu Cui, Haozhan Li, Jiacheng Chen, Chengqi Lyu, Wenwei Zhang, Qipeng Guo, Dahua Lin, Bowen Zhou, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09772 2026-08-27 cs.AI 版本更新 79%

Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

两个脑袋胜过一个:测试时扩展多智能体协作推理

Can Jin, Hongwu Peng, Qixin Zhang, Yang Zhou, Yujin Tang, Tong Che, Dimitris N. Metaxas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对单智能体测试时扩展(TTS)的瓶颈,提出用多智能体系统(MAS)升级TTS,引入M500数据集并结合CEO智能体的自适应策略,微调的Qwen2.5-32B-MAS等模型性能优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 75%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24958 2026-08-27 cs.SD cs.AI cs.CL 新提交 73%

Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace

我们能否解读音频大语言模型的思维?一个可解读的多语言中间层工作空间

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Qi Luo, Jia-Hong Huang, M. Maruf, Roger Ren, Yile Gu, Rahul Pandey, Ge Liu, Ivan Bulyko

机构 * Amazon AGI Foundations(亚马逊AGI基金会) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过logit lens分析Qwen3-Omni模型,发现其中间层可在输出前清晰呈现音频问题答案,揭示了音频模型推理的特性与信号分布,为解读音频大语言模型内部思维提供了定性依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25869 2026-08-27 cs.CL 新提交 70%

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

LLM作为评判者系统中的锚定偏差:先验分数损害评估独立性

Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

机构 * Infobip(英福比普(Infobip))

专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 该研究发现LLM-as-a-Judge系统存在锚定偏差,先验分数作为元数据会系统性偏移LLM的评估结果,且现有缓解措施效果有限,需针对性设计评估方案。

Comments 10 pages, full research paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-08-27 cs.CV 版本更新 67%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: https://internlm.github.io/OVO-S-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25922 2026-08-27 cs.CL cs.AI cs.IR 新提交 62%

Query-Side Attacks on GNN-Based KGQA: Tracing Failures from Entity Linking to Answer Generation

基于图神经网络的知识图谱问答(KGQA)的查询侧攻击:从实体链接到答案生成的失败溯源

Pankaj Kumar, Subhankar Mishra

机构 * National Institute of Science Education and Research(国家科学教育与研究学院) Homi Bhabha National Institute(霍米·巴巴国家学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基于GNN的KGQA流水线提出两种查询侧对抗扰动,发现子图构建是鲁棒性瓶颈,而非GNN推理,为KGQA的鲁棒性优化提供了明确方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25660 2026-08-27 cs.CL cs.AI 新提交 62%

Think-Probe-Respond: Improving Large Language Models as Judges of Research Idea Novelty

Think-Probe-Respond:提升大型语言模型作为研究创意新颖性评判者的能力

Tim Schopf, Tobias Schreieder, Akiko Aizawa

机构 * National Institute of Informatics(情报研究综合研究所) TU Dresden(德累斯顿工业大学) ScaDS.AI Dresden/Leipzig(德累斯顿/莱比锡应用数据科学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型评判研究创意新颖性时的“中等新颖”偏差,提出TPR轻量方法,通过探测推理阶段隐藏状态的潜在评判约束最终响应,使性能提升22.30%。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25325 2026-08-27 cs.AI cs.CL 新提交 62%

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

FinRiskAtlas:面向金融风险审查的决策对齐大语言模型评估

Suyang Zhong, Jingzhe Zhu, Qi Xu, Liyao Sun, Yin Wang, Qingqing Sun, Shuai Chen, Tianyi Zhang

机构 * Ant International(蚂蚁集团) Xiamen University(厦门大学) Shanghai University(上海大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向金融风险审查的中文基准FinRiskAtlas,从操作执行与证据状态控制两维度评估金融大语言模型,发现通用金融能力评分无法完全反映模型在专业工作流程中的可靠性,需采用决策对齐的评估单元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25005 2026-08-27 cs.CL cs.LG 新提交 62%

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

进行体悖论不一定存在于大型语言模型中:模型失效前的基准失效

Kaiqiao Han, Yizhou Sun

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现进行体悖论相关的基准失效,构建词汇匹配最小对并评估多步推理,揭示模型的充分性偏差等失效模式,表明部分大模型体分类性能可媲美人类标注者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-27 cs.CL cs.LG 版本更新 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals

详情

展开后加载摘要…

URL PDF HTML 收藏