arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 122 篇

2608.30672 2026-09-01 cs.AI cs.MA cs.MM 新提交 57%

HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving

HiRS-Agent:用于可靠长时程遥感任务解决的分层多智能体系统

Boyang Mu, Zhiwei Wei, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hunan Normal University(湖南师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HiRS-Agent分层多智能体系统,通过两层协作架构与优化策略,在Earth-Agent Benchmark和ThinkGeo上提升了长时程遥感任务的工具使用能力与正确性。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30556 2026-09-01 cs.AI 新提交 57%

AdaPath: Query-Adaptive Path-Finding via Path-Bank for Multi-Hop Implicit Biomedical KGQA

AdaPath:基于路径库的查询自适应路径查找用于多跳隐式生物医学知识图谱问答

Jun Hyeong Kim, Dongki Kim, Yinhua Piao, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文针对生物医学KGQA的两个挑战,提出AdaPath框架,通过Path-Bank检索查询自适应元路径,发布BioStrat-QA基准,在多个生物医学KGQA基准上性能优于基线。

Comments 25 pages, 6 figures, 30 tables

Journal ref EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30114 2026-09-01 cs.CL 新提交 57%

Manacá-1B: An Open, Reproducible Brazilian-Portuguese Language Model and a Tokenizer-Aware, Paired Evaluation

Manacá-1B:一个开源、可复现的巴西葡萄牙语语言模型及一种感知分词器的配对评估方法

Bruno Leonardo Santos Menezes, Carlos Leonardo Souza Cardoso, Fabio Andre Machado Porto

机构 * Laboratório Nacional de Computação Científica (LNCC)(国家科学计算实验室(LNCC))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对巴西葡萄牙语开源语言模型复现难、缺乏不确定性度量对比的问题,发布17.2亿参数的Manacá-1B模型及可复现流程,揭示分词器转换的评估陷阱并提供修复方案,所有资源可复现论文结果。

Comments Preprint. Code: https://github.com/Instituto-IA-LNCC/manaca-1b-base ; model weights: https://huggingface.co/menezesbruno/manaca-1b-base

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30076 2026-09-01 cs.CL 新提交 57%

Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects

面向单GPU大语言模型推理的预算感知压缩流水线:方法、权衡与耦合效应

Hongyu Yu, Yifei Shen

机构 * Lenovo Research(联想研究院) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对单GPU部署70B参数大语言模型的内存、吞吐量及集成成本问题,构建了含剪枝、量化、KV缓存压缩的预算感知压缩流水线,实现了模型压缩至33GB、57 tokens/s推理速度且精度损失在5%内的效果,提供了设计规则与评估协议。

Comments Accepted by GroundLM 2026 (EMNLP 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29948 2026-09-01 cs.CL 新提交 57%

XQDT: eXplainable and Quantitative Data-Text Alignment Metric with Feedback Signals

XQDT:带反馈信号的可解释定量数据-文本对齐指标

Kun Efimov-Zhang, Yifei Song, Claire Gardent

机构 * CNRS/LORIA(法国国家科学研究中心/洛里亚研究所) Université de Lorraine(洛林大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本文提出带反馈信号的可解释定量数据-文本对齐指标XQDT,通过微调语言模型识别数据-文本对的各类数据单元,在基准测试中性能优于LLM作为评判方法,可用于评估及下游修正优化。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29887 2026-09-01 cs.CL 新提交 57%

Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

查看计分板:多项选择题评估的计分方案分析

Nishant Balepur, Paiheng Xu, Wei Ai, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL

AI总结 该研究分析6种教育启发式计分方案对MCQA评估的影响,发现其可改变31个LLM的排名、更准确预测用户偏好,并揭示不同模型能力,还探讨了方案向其他任务的扩展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29662 2026-09-01 cs.CL 新提交 57%

ACTD: Anchor-Based Cross-Tokenizer Distillation with Residual Regularization

ACTD:带残差正则化的基于锚点的跨分词器蒸馏

Huiyi Zhang, Zijian Li, Xiaocheng Feng, Weitao Ma, Xiaoliang Yang, Yichong Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对跨分词器蒸馏的词汇与序列不对齐及对齐噪声问题,提出带残差正则化的ACTD方法,在五个推理基准上用三种教师模型评估取得SOTA,多教师扩展版性能优于基线。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29528 2026-09-01 cs.LG cs.DC cs.MA 新提交 57%

MedCache: Efficient and Temporally Valid Memory for Longitudinal Clinical Agents

MedCache:面向纵向临床智能体的高效且具备时间有效性的记忆机制

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Boyuan Zheng, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文针对纵向临床智能体的记忆设计问题,提出MedCache混合框架,经实验验证其可提升临床推理准确率与记忆效率,且具备跨模型骨干及外部数据集的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29431 2026-09-01 cs.CL 新提交 57%

Evaluating the Semantic Specificity of Representation Steering in Language Models

评估语言模型中表征引导的语义特异性

Zhangdie Yuan, Andreas Vlachos

机构 * University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出CRT诊断框架,发现LRS仅注入全局标签偏差而非修复推理回路,为区分真正推理修复与表面标签覆盖提供了严谨方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 57%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29241 2026-09-01 cs.CL 新提交 57%

When Patients Cut In: Extending Clinical Conversational AI Safety to Interruptions

当患者打断时:将临床对话人工智能的安全性扩展至打断场景

Zachary Ellis, Spencer Hazel, Adam Brandt, Yajie Vera He, Ernest Lim, Jared Joselowitz

机构 * Ufonia Limited(乌福尼亚有限公司) Newcastle University(纽卡斯尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对临床对话AI未考虑患者打断的问题,调整重叠类别为三种操作类型,测试四种LLM配置,发现竞争型FAQ打断下所有模型均出现信息覆盖失败,提出需按单元评估打断鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29208 2026-09-01 cs.RO cs.LG 新提交 57%

AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

AdaVLA:用于无需训练的视觉-语言-动作模型加速的自适应步长流匹配

Sunghwan Han, Youngtae Han, Youngmin Yi

机构 * Sogang University(西江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出AdaVLA,一种无需训练的自适应框架,通过流匹配轨迹曲率度量动态调整推理步骤与MLP剪枝率,在LIBERO基准等测试中实现VLA模型加速且性能下降可忽略。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29204 2026-09-01 cs.SE cs.AI 新提交 57%

AgentLogs: A Dataset for Opening the Black Box of GitHub's Cloud Agent

AgentLogs:用于揭开GitHub云智能体黑箱的数据集

Jonan Richards, Kosei Horikawa, Youmei Fan, Yutaro Kashiwa, Mairieli Wessel

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究推出AgentLogs数据集,包含GitHub上35810个热门仓库的智能体任务、会话及6400余万条日志,可用于研究智能体行为、协作等,填补了智能体贡献过程数据的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29030 2026-09-01 cs.AI 新提交 57%

Learning to Follow In-Context Watermark Instructions via Self-Distillation

通过自蒸馏学习遵循上下文水印指令

Yepeng Liu, Tianyi Chen, Xuandong Zhao, Dawn Song, Yuheng Bu

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 针对当前LLM无法同时遵循上下文水印指令并保持答案质量的问题,提出带logits扰动的自蒸馏(SDLP)与强化学习结合的两阶段训练方法,在Qwen3-14B和GPT-OSS-20B上显著提升水印可检测性且维持响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28691 2026-09-01 cs.CV cs.AI 新提交 57%

Defending Wearable VLMs Against Private Attribute Inference

防御可穿戴视觉语言模型(VLM)抵御私有属性推断

Zhimin Li, Pan Wang, Jingxian Chen, Yuantao Tang, Anthony Chen, Qian Lou, Jingtong Hu

机构 * Swanson School of Engineering, University of Pittsburgh(匹兹堡大学斯旺森工程学院) North Allegheny Senior High(北阿勒格尼高级中学) College of Engineering, Michigan State University(密歇根州立大学工程学院) University of Central Florida(中佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对可穿戴VLM的视觉令牌可能泄露私有属性的问题,提出TGAP方法,可大幅降低隐私推断准确率,同时维持较高效用,为可穿戴多模态AI的隐私保护提供可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29309 2026-09-01 cond-mat.mtrl-sci cs.AI physics.app-ph 新提交 57%

Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition

评估集成了材料合成工具的基于大语言模型(LLM)的智能体:以原子层沉积为例

Angel Yanguas-Gil

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究以原子层沉积为案例,提出了评估集成材料合成工具的基于LLM的AI智能体的实用框架,涵盖多类基准并可推广至其他材料合成技术。

Comments Invited prospective paper submitted to MRS Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25937 2026-09-01 cs.AI cs.MA 版本更新 57%

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

候选供给与答案选择塑造多智能体系统中大语言模型(LLM)评判的价值

Jia-Hao Ji, Sijie Li, Jiabei Cheng, Zixi She, Jin-Tai Yu, Zhiyuan Yuan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对多智能体系统中LLM评判的价值,通过分析多组基准数据集,发现结合答案频率与LLM评判可提升答案准确率,为设计多智能体架构提供了诊断基础。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-09-01 cs.AI cs.CV 版本更新 57%

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23986 2026-09-01 math.OC cs.AI cs.PF 版本更新 57%

The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

智能的影子价格:作为供应链问题的大语言模型推理质量退化

Elioth Sanabria

机构 * Lehigh University - College of Business(里海大学商学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文将LLM推理质量退化视为供应链问题,建模拥塞下的服务分配,揭示节流的反直觉影响,提出影子价格可毫秒级计算最优策略,证明拥塞时节流是需求杠杆而非成本杠杆。

Comments 40 pages, 12 figures. Numerical instances calibrated to public benchmark data for five LLM providers

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08528 2026-09-01 cs.LG 版本更新 57%

Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing

面向企业大语言模型代码助手的任务到模型优化:一种成本最优路由的数据驱动框架

Srinivasan Manoharan, Junhua Zhao, Fangbo Tu, Haifeng Wu, Jian Wan, Maliah Rajan M, Ashwin Hegde, Mithun Sasidharan, Kalyan Chakravarthi Podamekala

机构 * PayPal(贝宝(PayPal))

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本研究针对企业LLM代码助手的推理成本问题,提出T2MO数据驱动框架,通过任务分级与两级路由机制实现成本最优,可降低端到端成本并支持从静态策略到智能路由器的过渡。

Comments 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25891 2026-09-01 cs.AI cs.DB 版本更新 57%

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

梅西耶:用于跨基准智能体评估的高分辨率语料库

Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

机构 * Andromede AI(仙女座人工智能公司)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-09-01 cs.AI cs.MA 版本更新 57%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-09-01 cs.CL 版本更新 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

Comments Accepted to EMNLP 2026 Main Conference. Code: https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/sherloc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-09-01 cs.CV cs.CL 版本更新 57%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新 57%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13218 2026-09-01 cs.CL 版本更新 57%

When Similar Means Different: Evaluating LLMs on Arabic--Hebrew Cognates

当相似意味着不同:评估大语言模型在阿拉伯语-希伯来语同源词上的表现

Junhong Liang, Noor Abo Mokh, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆扎伊德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对阿拉伯语和希伯来语同源词、假朋友和借词,构建SemCog Bench基准(1858对词对),评估LLM跨语言语义理解,发现模型依赖表面形式相似性,在假朋友和借词上表现差,上下文帮助有限。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09389 2026-09-01 cs.CL 版本更新 57%

LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

LexRubric:面向开放式法律任务的基于评分指南的诊断基准

Yifan Chen, Haitao Li, Yiran Hu, Kaisong Song, Jun Lin, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06037 2026-09-01 cs.SD cs.CL eess.AS 版本更新 57%

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

SpeechJBB:探究大型音频语言模型在代码切换语音下的安全对齐与理解

Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SpeechJBB数据集,通过代码切换有害音频和伪词插入方法,揭示大型音频语言模型在多语言和口语设置下的安全漏洞。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-09-01 cs.CV cs.CL cs.RO 版本更新 57%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments EMNLP 2026 Findings, Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-09-01 cs.AI q-fin.PM 版本更新 57%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏