arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1722 篇

2607.10291 2026-07-14 cs.SE cs.AI 新提交 74%

Partial Contracts Suffice: Sound, LLM-Inferred Regression Verification

部分契约就足够了:可靠的、由大语言模型推断的回归验证

Yiannis Charalambous, Rafael Menezes, Youcheng Sun, Lucas C. Cordeiro

机构 * The University of Manchester(曼彻斯特大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 研究软件回归验证难题,提出基于契约的工具,探讨部分契约的充分性,通过强化契约、自动推断等方法,实现可靠验证,在多方面取得良好效果,证明安全保留条件等价性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04945 2026-07-07 cs.CL 新提交 74%

You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism

你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理

Katharina Soemer, Helena Mihaljević

机构 * Goethe University, Frankfurt(法兰克福歌德大学) HTW Berlin(柏林工业大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17539 2026-06-17 cs.CV cs.AI 新提交 74%

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

空间视觉语言模型中的双路径推理强化

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) University of California, San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21863 2026-08-25 cs.CL cs.AI 新提交 73%

HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化

Yucan Guo, Xiaohan Wang, Miao Su, Saiping Guan, Zhongni Hou, Jiajun Chai, Wei Lin, Guojun Yin, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 HiDiffTIR是面向多轮工具集成推理的分层难度感知策略优化框架,通过在轨迹和轮次两级执行难度感知信用分配,无需额外监督即可提升工具集成推理性能。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20362 2026-08-24 cs.CL cs.LG 新提交 73%

Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck

RLVR中的多语言验证器偏差:基准、推理诊断与跨语言选择瓶颈

Chenyu Zhou, Qiliang Jiang, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo(科学东京大学工程学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现多语言RLVR中存在验证器偏差,引入审计协议定位到最终答案接口的机制,提出跨语言选择瓶颈,rule-GRPO可提升可信准确率。

Comments 16 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19408 2026-08-21 cs.AI cs.LG 新提交 73%

Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress

超越模仿:通过推理进度过滤在线策略蒸馏

Chen Yang, Haiyuan Wan, Rengrong Xiong, Yize Chen, Danny H. K. Tsang

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中教师奖励与真实推理进度不匹配的问题,提出R2-OPD方法,通过过滤冲突奖励提升推理性能,实现对标准OPD的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17938 2026-08-19 cs.CL cs.AI 新提交 73%

Grading Needs a Rubric, Not Intelligence

评分需要评分标准,而非智能

Jhen-Ke Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17895 2026-08-19 cs.CL cs.AI 新提交 73%

BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

BEAR-Bench:面向多模态模型的双语企业与学术推理基准

Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev

机构 * Yandex Applied AI Institute(Yandex应用人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型在文本密集专业文档推理能力评估的不足,推出英俄双语的BEAR-Bench基准,评估16个多模态大语言模型并对比幻觉检测方法,发现最强模型仍有明显性能提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13160 2026-08-14 cs.CL cs.AI 新提交 73%

Better Decomposition, Free Aggregation: A Synthesizer-Folding Framework for Multilingual Multi-Hop Question Answering

更好的分解,自由聚合:面向多语言多跳问答的合成器折叠框架

Yilin Wang, Yuchun Fan, Weidong Bao, Zili Wei, Shi Feng, Tong Xiao, Zhengtao Yu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Kunming University of Science and Technology(昆明理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言多跳问答中现有方法的翻译噪声与错误放大问题,提出Syfer框架,通过推迟翻译、格式受限分解与质量检查实现性能与成本的良好平衡。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12836 2026-08-14 cs.CL cs.AI 新提交 73%

From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options

从原子证据到逻辑组合:针对复合答案选项的结构化组合推理

Obed Junias, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型处理复合逻辑答案选项时的失败问题,提出了一种分解原子判断并结合整数线性规划的框架,在LOGICAL-COMMONSENSEQA和LOGICAL-SATA基准上显著提升了宏F1指标。

Comments 21 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10916 2026-08-12 cs.CL cs.AI cs.LO 新提交 73%

FaithformBench: Benchmarking Faithfulness of Mathematical Chain-of-Thought Autoformalisation

FaithformBench:数学链式思维自动形式化的忠实性基准测试

Rob Cornish, Iacopo Ghinassi, Po-Hung Yeh, Shuqi Liu, Qiyuan Xu, Haoxuan Yin, Dominik Wagner, Wenda Li, Yee Whye Teh, Luke Ong

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出新基准FaithformBench,通过自动生成扰动推理步骤评估AF系统的忠实性,发现多数AF存在“悄悄修正”无效输入的谄媚现象,当前AF在有效性与无效性保留间存在张力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10537 2026-08-12 cs.AI cs.LG 新提交 73%

Measuring Semantic Abstractness of SAE Features via Nonlocality

通过非局部性测量SAE特征的语义抽象性

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06425 2026-08-10 cs.CL cs.LG 新提交 73%

NTDH: Complex Reasoning for Comprehensive Affective Analysis

NTDH:用于综合情感分析的复杂推理

Tianlei Zhu, Zhiwei Liu, Yuyan Wang, Xiao-Yang Liu, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) The University of Manchester(曼彻斯特大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对综合情感分析的挑战,提出NTDH方法,通过自然化、感知容差门等策略,在少数据量下提升性能,获最优EI-reg结果。

Comments 16 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 73%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 73%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04444 2026-08-06 cs.CL cs.AI 新提交 73%

D$^2$F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation

D²F-ReAG:面向多跳推理增强生成的动态分解与过滤

Jiaoyang Li, Junhao Ruan, Shengwei Tang, Kaiyan Chang, Zhengtao Yu, Tong Xiao, Jingbo Zhu

机构 * Northeastern University(东北大学) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research(NiuTrans研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有检索增强生成(RAG)处理多跳问题时缺乏动态分解与有效过滤的缺陷,提出D²F-ReAG范式,通过判断根级推理可靠性自适应控制推理深度,经实验验证其处理复杂多跳问题的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04285 2026-08-06 cs.AI cs.LG 新提交 73%

The RAIL Principles for Neurosymbolic AI: Reasoning, Assurances, Interfacing and Learning

神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)

Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang

机构 * Politecnico di Milano(米兰理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) Åbo Akademi University(奥博 Akademi 大学) Samsung AI(三星人工智能研究院) Delft University of Technology(代尔夫特理工大学) Stony Brook University(石溪大学) Politecnico di Torino(都灵理工大学) University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨工业大学) Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) BrainCreators(BrainCreators公司) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) University of Edinburgh(爱丁堡大学) UCLA(加利福尼亚大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04001 2026-08-05 cs.LG cs.AI 新提交 73%

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

推理大语言模型中的测试时缩放:推理机制、评估与可复现性

Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对推理大语言模型的测试时缩放,明确三种推理机制,提出系统评估原则与可复现性要求,应用于多类基准并发布超20亿条推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03882 2026-08-05 cs.CL cs.AI cs.IR 新提交 73%

MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准

Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03401 2026-08-05 cs.LG cs.AI 新提交 73%

Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

更短的推理,更早的答案?对推理接口的评估

Francesca Carlon, Vincent Ginis, Andres Algaba

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估大型语言模型的推理接口,测试提示词和训练设置对推理长度、准确率的影响,发现早答指令和低 effort 推理在特定 token 限制下可提升部分数据集准确率,需综合报告多维度评估指标。

Comments 52 pages, 13 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02867 2026-08-05 cs.CL cs.AI 新提交 73%

BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

BODHI:大型语言模型是否会分支拓展并发现异构推理?

Soumadeep Saha, Krish Sharma, Akshay Chaturvedi, Nicholas Asher

机构 * ANITI, Université de Toulouse(图卢兹大学ANITI) LINAGORA Labs(LINAGORA实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过迷宫求解实验和BODHI-Trees分析,发现RLVR训练的LLMs存在策略熵崩溃,其采样效率提升以推理分支多样性下降为代价。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 73%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01283 2026-08-04 cs.LG cs.AI 新提交 73%

Riemannian Attention Mechanisms for Transformers: A Theoretical Framework and Architecture Design

用于Transformer的黎曼注意力机制:理论框架与架构设计

Sen Song

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对Transformer自注意力栈的秩双指数衰减问题,提出用逐token黎曼度量替代欧几里得度量的理论框架,设计纤维丛Transformer架构,推导相关理论预测并明确核心开放问题。

Comments 23 pages, theoretical paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00434 2026-08-04 cs.CL cs.AI 新提交 73%

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

AdaMTP:一种面向多令牌预测的自适应训练范式

Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AdaMTP是适配序列内在可预测性的自适应MTP训练范式,通过熵算法划分语义边界抑制噪声梯度,在三类主干模型的多任务基准中均优于标准MTP,兼具性能与推理速度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29241 2026-08-03 cs.IR cs.AI cs.CL 新提交 73%

RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

RecHarness:用于自进化推荐系统的多臂老虎机路由智能体框架

Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao, Shuwen Kang, Chi Lu, Wenjin Wu, Peng Jiang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RecHarness是一种多臂老虎机路由智能体框架,用于自动化优化推荐系统模型,通过分离方向选择与假设生成、引入跳盆机制提升稳定性,在多任务测试及在线A/B测试中均实现性能提升。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24779 2026-07-29 cs.AI cs.LG 新提交 73%

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

HOBA:用于自适应在线广告的分层策略性投标代理

Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

机构 * Kuaishou Technology(快手科技)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对在线广告投标系统问题,提出 HOBA 分层强化学习框架,在三个时间尺度解耦相关环节,通过实验验证其优于现有基线,大规模在线部署实现目标成本提升 3.6%,证明该范式有效。

Comments 10pages,accepted by KDD 2026 ads track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22385 2026-07-27 cs.AI cs.LG 新提交 73%

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

通过基于证据的推理进行智能根本原因分析

Amaury Wei, Olga Fink

机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20543 2026-07-24 cs.LG cs.AI 新提交 73%

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion

当可验证奖励的强化学习缩小推理边界时:诊断Pass@k反转

Todd Zhou

机构 * Harvard University(哈佛大学)

专题命中 推理与问题求解 :post-training(abstract);language agent(abstract);分类 cs.AI、cs.LG

AI总结 研究RLVR中的Pass@k反转问题,提出双模式解释和PBA方法,通过实验表明PBA能提升\PassK{1}和覆盖率,诊断出普通GRPO丢失基础可解决提示,而PBA保留罕见阳性轨迹,强调训练后推理要兼顾优化强度与提示安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20440 2026-07-24 cs.CL cs.AI 新提交 73%

Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility

先回答再编辑:用于保留效用的反蒸馏的推理骨架编辑

Fan Li, Mengting Pan, Sijia Xu, Xiaoyang Wang, Chen Chen, Wenjie Zhang

机构 * School of Computer Science and Engineering, UNSW Sydney(新南威尔士大学计算机科学与工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对专有大语言模型易受知识蒸馏影响的问题,提出骨架引导推理编辑框架SGRE,通过先回答再编辑的方式,借鉴认知负荷理论对推理痕迹进行修改,在降低蒸馏效果的同时保持推理准确性和痕迹自然度。

Comments 21 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19856 2026-07-23 cs.CL cs.AI cs.CE 新提交 73%

Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering

FinMMEval 2026任务1概述:多语言金融多项选择题问答

Zhuohan Xie, Yuyang Dai, Rania Elbadry, Vanshikaa Jani, Georgi Georgiev, Dimitar Dimitrov, Fan Zhang, Xueqing Peng, Lingfei Qian, Jimin Huang, Jiahui Geng, Yankai Chen, Ye Yuan, Haolun Wu, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Mingzi Song, Yu Chen, Xue Liu, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”INSAIT学院) University of Arizona(亚利桑那大学) FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”FMI学院) The Fin AI(The Fin AI公司) The University of Tokyo(东京大学) Linköping University(林雪平大学) McGill University(麦吉尔大学) Mila, Quebec AI Institute(魁北克Mila人工智能研究所) Meiji Gakuin University(明治学院大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 FinMMEval 2026任务1测试多语言金融多项选择题问答,最终测试集含800题,每种语言200题,按准确率排名。最高准确率在92.0%(印地语)到97.5%(英语和阿拉伯语)之间,领先团队相近。系统采用检索增强等多种方法。

Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏