arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 160 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 47 篇

2608.20574 2026-08-28 cs.AI cs.CY cs.LG cs.SE 版本更新 62%

FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen, Erim Hayretci

机构 * Imperial College London(帝国理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 18 pages, 11 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Adds reward-map sensitivity, selection and metric robustness, held-out Recipe1MSubs substitution validation, and a preregistered controlled reward-transfer study. Code, dataset, and interactive leaderboard links remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-08-28 cs.CL cs.AI 版本更新 62%

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08801 2026-08-28 cs.LG cs.CL 版本更新 62%

$p1$: Better Prompt Optimization with Fewer Prompts

用更少提示实现更好的提示优化

Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Microsoft(微软) Harvard University(哈佛大学) Databricks AI Research(Databricks AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-08-28 cs.CL cs.AI cs.IR 版本更新 62%

LLM-Specific Utility for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27135 2026-08-28 cs.CL 新提交 57%

Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models

语音与文本的不同解读:多模态模型中的跨模态不稳定性

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所(哈马德·本·哈利法大学))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对多模态模型在语音与文本、英语与阿拉伯语间的判断一致性问题,构建含10150张图像的基准,发现模态与语言转换会引入未被整体准确率捕捉的不一致性,语音还会放大部分失败,且公开了该基准。

Comments Interpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27110 2026-08-28 cs.CL 新提交 57%

DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali

DocTalkBN:孟加拉语专家远程医疗对话的新型数据集

Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi, Ananya Shahrin Promi, Wahid Al Azad Navid, Rifat Shahriyar

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对低资源语言孟加拉语医疗对话数据稀缺问题,构建了DocTalkBN多模态数据集,含大量真实远程医疗对话数据,并设置三项下游任务进行基准测试,为医疗NLP研究提供实用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27021 2026-08-28 cs.NI cs.AI 新提交 57%

FaulT-Bench: Towards Benchmarking Network Troubleshooting LLM Agents under Unreliable User Tickets

FaulT-Bench:面向不可靠用户工单场景下网络故障诊断大语言模型智能体的基准测试

Kuan-Hao Tseng, Niruth Bogahawatta, Yasod Ginige, Kunjan Patel, Kosta Dakic, Suranga Seneviratne

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FaulT-Bench 是针对网络故障诊断 LLM 智能体的基准测试,涵盖含虚假工单的 200 个场景,评估 SADE 等智能体后发现其在错误工单上性能骤降,可用于开发可靠的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26982 2026-08-28 cs.CL 新提交 57%

JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols

JudgeStealer:跨评估协议提取大语言模型评判能力

Chen Chen, Yaolin Chen, Xuehan Sun, Juan Lin, Xueluan Gong, Yuhang Zheng, Qian Wang, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 JUDGESTEALER是首个跨评估协议提取LLM评判能力的高效查询框架,通过利用跨协议一致性等技术提升提取效果,在三类评估任务上优于基线且具鲁棒性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26730 2026-08-28 cs.AI 新提交 57%

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training

知晓何时不重用:自主大语言模型后训练中的条件经验迁移

Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对自主大语言模型后训练中经验重用的决策问题,提出BCIT方法,通过绑定效果上下文、检查条件等减少有害更新,提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26685 2026-08-28 cs.IR cs.CL cs.DL 新提交 57%

BLANC: Discovering Patent White Space via Changes in Normalized Pointwise Mutual Information Between Multi-View Clusters

BLANC:通过多视图簇间归一化点间互信息变化发现专利空白区域

Shuichi Miyazawa, Kensuke Fujii

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本研究提出BLANC三阶段流程,通过多视图神经主题建模、NPMI及ΔNPMI检测,在USPTO等语料库中成功恢复专利空白区域,其特异性优于单视图聚类与现有共现度量。

Comments 15 pages, 4 figures, 10 tables. A preliminary Japanese-language report covering the methodology and the industrial case study is scheduled to appear as AGC Research Report 76 (2026), ISSN 2434-0774. The present article is the full version, containing the entire quantitative evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26596 2026-08-28 cs.CL 新提交 57%

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习

Rongjin Li, Yuanxin Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) WeChat AI, Tencent Inc.(腾讯微信人工智能部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26581 2026-08-28 cs.LG 新提交 57%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26374 2026-08-28 cs.CL 新提交 57%

Survival-Guided Length Control for Efficient Diffusion Language Models

用于高效扩散语言模型的生存引导式长度控制

Ivan Kobyzev, Abbas Ghaddar, Yufei Cui

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对扩散语言模型解码时存在不必要去噪步骤的问题,提出生存引导式长度预测器,可将推理速度最高提升7倍且保持任务准确率,同时发现模型性能对所选预测长度敏感。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23758 2026-08-28 cs.SD cs.AI 版本更新 57%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-28 cs.CL 版本更新 57%

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-08-28 cs.SE cs.AI 版本更新 57%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-28 cs.CV cs.CL 版本更新 57%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-08-28 cs.CL 版本更新 57%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21165 2026-08-28 cs.CL cs.CV 版本更新 57%

Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects

多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Shubhashis Roy Dipta, Mahbub E Sobhani, Rubaya Tabassum, Ariful Ekraj Hridoy, Mehraj Mahmood, Md. Tarek Hasan, Swakkhar Shatabda

机构 * United International University(国际联合大学) BRAC University(布拉塔克大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14104 2026-08-28 cs.CL 版本更新 57%

Legal Rule Induction: Towards Generalizable Principle Discovery from Analogous Judicial Precedents

法律规则归纳:从类似司法判例中发现可泛化的原则

Wei Fan, Tianshi Zheng, Yiran Hu, Zheye Deng, Weiqi Wang, Baixuan Xu, Chunyang Li, Haoran Li, Weixing Shen, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) School of Law, Tsinghua University, Beijing, China(清华大学法学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究定义法律规则归纳任务,构建首个相关基准数据集,发现先进LLMs存在过度泛化和幻觉问题,经该数据集训练可提升其捕捉类似案件细微规则模式的能力。

Comments Accepted by EMNLP2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27065 2026-08-28 cs.CV 新提交 50%

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏

Ziyue Wang, Shiqi Huang, Weiwen Xu, Bihan Wen, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交 50%

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 18 篇

2608.27348 2026-08-28 cs.CL 新提交 86%

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26870 2026-08-28 cs.AI cs.CL cs.SI 新提交 84%

C-Unseen: Weak Signal Detection in Dynamic Temporal Knowledge Graphs via LLM Reasoning

C-Unseen:基于大语言模型推理的动态时序知识图谱中的弱信号检测

Yassir Lairgi, Ludovic Moncla, Khalid Benabdeslem, Rémy Cazabet, Pierre Cléau

机构 * INSA Lyon(里昂国立应用科学学院) CNRS(法国国家科学研究中心) UCBL(里昂第一大学) GAUC

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C-Unseen框架,通过LLM的思维链推理识别动态时序知识图谱中与主导叙事有张力的罕见子图并追踪其持续性,实现弱信号检测,性能优于各类基线方法。

Comments Accepted at the AI4SE 2026 Special Track, held within the WISE 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26125 2026-08-28 cs.CL cs.AI 新提交 81%

Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales

多语言仇恨言论检测的训练时可解释性:对齐模型推理与人类理由

Muhammad Deedahwar Mazhar Qureshi, Sannaan Khan, Muhammad Atif Qureshi, Wael Rashwan

机构 * Technological University Dublin(都柏林理工大学) National University of Sciences and Technology(国家科技大学) Maynooth University(梅努斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多语言仇恨言论检测的不透明问题,提出训练时可解释性框架,对齐模型推理与人类理由,经HateXplain、BullySent数据集及多方法评估,可提升分类性能与解释质量,助力多语言文化敏感的内容审核。

Comments Accepted at NeurIPS Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27036 2026-08-28 cs.CL 新提交 79%

Reasoning about In-Context Samples for Machine-Translation

针对机器翻译的上下文示例推理

Maxime Bouthors, Josep Crego, François Yvon

机构 * SYSTRAN by ChapsVision Sorbonne Université(索邦大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于片段的推理框架,结合Qwen3模型家族在6种语言(每语言最多5领域)的实验,验证其机器翻译性能优于标准k-shot等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-08-28 cs.LG stat.ML 版本更新 70%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21599 2026-08-28 cs.IR cs.AI cs.LG 版本更新 62%

Refine-POI: Reinforcement Fine-Tuned Large Language Models for Next Point-of-Interest Recommendation

Refine-POI: 通过强化微调优化大型语言模型用于下一步兴趣点推荐

Peibo Li, Shuang Ao, Hao Xue, Yang Song, Maarten de Rijke, Johan Barthélemy, Tomasz Bednarz, Flora D. Salim

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Refine-POI通过拓扑感知ID生成和强化微调,解决LLMs在POI推荐中的语义连续性和top-k推荐问题,提升推荐准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26949 2026-08-28 cs.AI 新提交 57%

A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering

一张表格值64个Token:面向多表格文档问答的像素级压缩

Iñigo Alonso, Mirella Lapata

机构 * School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对多表格文档问答提出无需训练的两步像素级表格压缩方法,在长文档上节省41%总Token,比高效单步压缩配置少用15%Token且无准确率损失,还较原生分辨率单步问答提升7个百分点准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交 57%

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏