arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-18 至 2026-08-18 共收录 217 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 57 篇

2608.14896 2026-08-18 cs.CL cs.LG 新提交 76%

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理

Florian Braun

机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) Sakana AI Tohoku University(东北大学) RIKEN AIP(理化学研究所先进智能项目中心) Institute of Science Tokyo(东京科学大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。

Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 75%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14552 2026-08-18 cs.AI 新提交 74%

Large Language Models Show Metacognitive Sensitivity in Medical Reasoning

大型语言模型在医学推理中表现出元认知敏感性

Ahmad Nazzal

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本研究开发临床基准测试医学LLM,发现其在AT-NCD与DRCI鉴别中具部分元认知敏感性,错误集中于冲突病例,建立了医学LLM相关评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-08-18 cs.CL cs.AI 版本更新 73%

Multimodal Language Models Benchmarked Against the NRC Reactor Operator Licensing Examination: Fine-Tuning and Retrieval Strategies

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee, Syed Bahauddin Alam

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15983 2026-08-18 cs.SE cs.AI cs.LG math.OC 版本更新 73%

ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization

ReLoop:结构建模与行为验证用于可靠的基于LLM的优化

Junbo Jacob Lian, Yujun Sun, Huiling Chen, Chaoyu Zhang, Hanzhang Qin, Chung-Piaw Teo

机构 * McCormick School of Engineering, Northwestern University(西北大学工程学院) Wenzhou Buyi Pharmacy Chain Co., Ltd.(温州-buyi药链有限公司) College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Decision Analytics and Operations, City University of Hong Kong(香港城市大学决策分析与运营部门) Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹学与分析研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 ReLoop通过结构生成和行为验证机制,解决LLM生成优化代码的可行性与正确性差距问题,提升代码执行准确性和鲁棒性。

Comments Code and benchmark: https://github.com/junbolian/ReLoop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18334 2026-08-18 cs.SE cs.AI cs.LG 版本更新 73%

Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought

LLMs能否像自动定理证明器一样进行Rust验证?VCoT-Bench:通过验证思维链进行评估

Zichen Xie, Wenxi Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VCoT-Bench,通过验证思维链评估LLMs在Rust验证中的能力,揭示其在不同证明类型和缺失证明情况下的脆弱性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16594 2026-08-18 cs.AI 新提交 70%

CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction

CACSurv:基于大型语言模型的一致性对齐比较学习用于癌症生存预测

Tianqi Xiang, Qixiang Zhang, Xinpeng Ding, Yi Li, Xiaomeng Li

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对癌症生存预测中LLM时间回归的公式与监督不匹配问题,提出CACSurv框架,构建TCGA-SurvReport基准,在6个TCGA癌症队列上的平均C指数达0.722,显著优于现有模型与基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 67%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-18 cs.AI cs.CL cs.LG cs.MA cs.MM 版本更新 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Yijun Chen, Buqiang Xu, Mingjun Mao, Xinjie Liu, Haoming Xu, Shuofei Qiao, Mengru Wang, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jason Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: http://mobilemem.openkg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05183 2026-08-18 cs.CL cs.AI cs.HC 版本更新 66%

The Granularity Gap: A Multi-Dimensional Cross-Generational Audit of Sycophancy in Gemini Models

粒度差距:Gemini 模型中谄媚行为的多维纵向审计

Patrick Keough

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 通过多维度分级评估(Likert 0-4),揭示 Gemini 模型在连续尺度上的谄媚行为,发现粗粒度二值指标掩盖了大量社会顺从行为,且代际进步非单调,存在对齐税(谄媚与真实性负相关)。

Comments v2: Major correction. Three v1 claims withdrawn (U-shaped detection curve, recalibration remedy, one reliability figure); the central 29% result survives. Adds a four-judge panel over a stratified 1,200-response sample, 10,792 votes with written reasoning. Data unchanged from v1. 21 pages, 8 figures, 18 tables. Itemized changelog and code: https://github.com/pskeough/The-Granularity-Gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15630 2026-08-18 cs.HC cs.AI cs.CL 新提交 62%

Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis

评估工具对人类和大语言模型(LLMs)是否测量相同的内容?潜在结构分析

Alona Strugatski, Licol Zeinfeld, Giora Alexandron

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过探索性因子分析等方法,发现高中化学和大学入学考试定量推理部分的评估,对人类与六个多模态LLMs测量的潜在结构存在系统性差异,质疑了此类评估用于推断AI能力的效度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15032 2026-08-18 cs.CL cs.AI cs.CV 新提交 62%

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

机构 * Handoff AI Research(汉德夫人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。

Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14999 2026-08-18 cs.CL cs.AI 新提交 62%

RamseyGadgets: A Graph Construction Dataset for LLMs

RamseyGadgets:面向大语言模型(LLMs)的图构造数据集

Zohair Raza Hassan, Deepak Pandita

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出新型图构造数据集RamseyGadgets,评估5个开源LLMs在其70个拉姆齐良图问题上的表现,发现LLMs在困难问题上准确率仅37.70%,Gemma-4-31B性能最优,还可用于确定提升LLMs表现的提示类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-18 cs.LG cs.AI 新提交 62%

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14606 2026-08-18 cs.CY cs.AI cs.CL stat.AP 新提交 62%

Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents

看似合理但并非有效:对大型语言模型(LLMs)作为合成调查受访者的心理计量学审查

Mantas Lukauskas, Viktorija Šarkauskaitė

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过心理计量学分析发现,虽LLMs可复现人类调查关系的定性方向,但其心理计量学相似性不及高斯copula基线,且存在默许偏移、预测效度下降等问题,无法作为人类调查数据的直接替代品。

Comments 50 pages, 9 figures. Under review. Code and data will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14345 2026-08-18 cs.LG cs.AI cs.CR 版本更新 62%

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

价值泄露:大语言模型的答案被其自身价值观悄然塑造

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型存在价值泄露问题,即其答案受自身价值观影响却未向用户披露。为此引入评估套件量化,发现模型受多种价值观影响,前沿模型差异大,价值泄露是新的失败模式,当前训练和评估未充分解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 62%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-18 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 62%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon; Make the title consistent w/ pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06039 2026-08-18 cs.CL cs.AI 版本更新 62%

A Large-Scale Chinese Knowledge Graph-Text Alignment Dataset for Benchmarking Knowledge-Grounded LLMs

用于评估知识增强型大语言模型的大规模中文知识图谱-文本对齐数据集

Chengwei Wu, Xingrui Zhuo, Mingyang Gao, Xinghe Cheng, Zhichao Yan, Jiapu Wang

机构 * Nanjing University of Science and Techonolgy(南京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology Beijing(北京科技大学) Hefei University of Technology(合肥工业大学) Beijing University of Chemical Technology(北京化工大学) Renmin University of China(中国人民大学) Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) Griffith University, Australia(澳大利亚格里菲斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出大规模中文知识图谱-文本对齐数据集CDTP,支持三项中文知识密集型任务的评估,经实验验证其可提升LLM的领域性能与分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16852 2026-08-18 cs.AI 新提交 57%

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

合规检测器读取什么?激活探针与防护模型的审计

Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(雷克西实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 57%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15592 2026-08-18 cs.AI 新提交 57%

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义

Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15090 2026-08-18 cs.CV cs.LG 新提交 57%

Distribution-free false-alarm calibration and chance-corrected spatial evaluation for industrial anomaly detection

面向工业异常检测的无分布虚警校准与经机会校正的空间评估

Jie Deng

机构 * Tongji University(同济大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 57%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-18 cs.CY cs.AI cs.HC 版本更新 57%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 19 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 57%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 57%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-08-18 cs.CR cs.AI 57%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11374 2026-08-18 cs.CL cs.CY 57%

Mining Legal Arguments to Study Judicial Formalism

从法律论证中研究司法形式主义

Tomáš Koref, Lena Held, Mahammad Namazov, Harun Kumru, Yassine Thlija, Ivan Habernal

机构 * Center for Critical Computational Studies(批判性计算研究所以) Goethe University Frankfurt(法兰克福歌德大学) Department for Legal Theory and Legal Doctrines, Faculty of Law(法学院法律理论与法律学说系) Charles University(查尔斯大学) Technical University of Darmstadt(达姆施塔特技术大学) Research Center Trustworthy Data Science and Security of the University Alliance Ruhr & Ruhr University Bochum(鲁尔大学博德姆大学可信数据科学与安全研究所以)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过自动化方法分析捷克最高法院判决中的法律论证,建立MADON数据集,验证了东欧司法形式主义的主张,提升了司法决策分类的准确性和可解释性。

Comments pre-print under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-08-18 cs.AI 版本更新 57%

ML-AutoResearch: Training Machine Learning Research Agents with Automatically Generated Environments

通过合成任务扩展实现AI科学家

Ziyang Cai, Amir Saeidi, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏