arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2510.15994 2026-03-25 cs.CR cs.AI 57%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22492 2026-03-25 cs.AI 57%

RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts

RealCQA-V2:结构化科学图表视觉蕴含的诊断基准

Saleem Ahmed, Srirangaraj Setlur, Venu Govindaraju

机构 * University at Buffalo, Buffalo, NY, USA(布法罗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RealCQA-V2通过将图表问答转化为视觉前提证明任务,提供结构化视觉蕴含验证,揭示多模态推理中的局部-全局推理差距。

Comments Under Review : Code and Data will be made public soon - https://cse-ai-lab.github.io/VPP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23229 2026-03-25 cs.CL 57%

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义

Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) National Research Council Canada(加拿大国家研究委员会)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了八种最先进的生成式多模态大语言模型在检测和解释六种隐喻意义类型上的能力,并通过人工评估验证其解释的合理性与忠实性。

Comments LREC 2026, 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22939 2026-03-25 cs.CV cs.LG 57%

FixationFormer: Direct Utilization of Expert Gaze Trajectories for Chest X-Ray Classification

FixationFormer:直接利用专家凝视轨迹进行胸部X光分类

Daniel Beckmann, Benjamin Risse

机构 * Institute for Geoinformatics(地理信息研究所) Department of Computer Science(计算机科学系) University of Münster(穆斯堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出FixationFormer,通过将专家凝视轨迹作为序列建模,利用Transformer架构提升胸部X光分类性能,实现更直接的专家诊断信息整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22777 2026-03-25 cs.AI 57%

AgriPestDatabase-v1.0: A Structured Insect Dataset for Training Agricultural Large Language Model

AgriPestDatabase-v1.0:用于训练农业大语言模型的结构化昆虫数据集

Yagizhan Bilal Durak, Ahsan Ul Islam, Shahidul Islam, Ashley Morgan-Olvera, Iftekhar Ibne Basith, Syed Hasib Akhter Faruqui

机构 * Sam Houston State University(萨姆豪斯敦州立大学) Kennesaw State University(肯纳威克州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AgriPestDatabase-v1.0,构建了结构化昆虫数据集并采用轻量级LLM进行微调,以提升农业害虫管理的决策支持能力。

Comments Accepted in Artificial Super Intelligence Conference 2026 (Sponsored by KSU PLOT & IEEE CIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22576 2026-03-25 cs.CL 57%

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

CAPITU:一个评估巴西葡萄牙语指令遵循能力的基准,具有文学背景

Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CAPITU基准通过八部巴西文学经典作品背景,结合可验证指令约束与文化内容,评估LLM在巴西葡萄牙语中的指令遵循能力,测试18种前沿模型,揭示多轮对话中约束持久性差异及形态学约束等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22561 2026-03-25 cs.AI 57%

AI Mental Models: Learned Intuition and Deliberation in a Bounded Neural Architecture

AI 心智模型:在有限神经架构中学习的直觉与推理

Laurence Anthony

机构 * Waseda University(早稻田大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨有限神经架构是否能在经典64项演绎推理基准上实现直觉与推理的分工。研究提出双路径架构,通过直觉与推理路径的分离,展示出在交叉验证中推理路径的显著优势,表明模型具备结构化内部计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22499 2026-03-25 cs.CR cs.LG 57%

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

OrgForge-IT:一种可验证的合成基准用于基于大语言模型的内部威胁检测

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出OrgForge-IT,一种可验证的合成基准,通过确定性模拟引擎和语言模型生成表面文本,确保跨 artifact 一致性。研究发现多模型 leaderboard 显示,三类威胁和八种可注入行为的检测策略存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11488 2026-03-25 cs.CL cs.SD eess.AS 57%

When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration

当音频大模型不听:一种跨语言的模态仲裁研究

Jayadev Billa

机构 * San Jose, CA, USA(美国加州圣何塞) Yahoo(雅虎) Nuance(Nuance公司) BBN(BBN公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现音频与文本冲突时,语言模型更倾向于遵循文本而非音频,通过ALME数据集和TDR指标揭示模态仲裁中的信息内容与仲裁易用性差异。

Comments 13 pages, 18 tables, 4 figures, benchmark and code at https://github.com/jb1999/alme-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI 57%

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 57%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03235 2026-03-24 cs.AI 57%

From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers

从五维到更多:大型语言模型作为精确且可解释的心理档案师

Yi-Fei Liu, Yi-Long Lu, Di He, Hang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型能否通过少量量化输入建模人类心理特质的相关结构,发现其在零样本情况下能准确预测心理特质,揭示了LLM通过抽象和推理实现精确预测的机制。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21329 2026-03-24 cs.IR cs.AI 57%

COINBench: Moving Beyond Individual Perspectives to Collective Intent Understanding

COINBench: 超越个体视角到集体意图理解

Xiaozhe Li, Tianyi Lyu, Siyi Yang, Yizhao Yang, Yuxi Gong, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 COINBench通过动态实时更新的基准测试,评估大语言模型在消费者领域集体意图理解能力,揭示当前模型在复杂意图合成分析深度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI 57%

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21248 2026-03-24 cs.CL cs.IR 57%

Graph Fusion Across Languages using Large Language Models

跨语言图融合使用大型语言模型

Kaung Myat Kyaw, Khush Agarwal, Jonathan Chan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型进行跨语言图融合框架,通过结构线性化和语义优先级解决多语言知识图谱融合问题,展示了LLM在跨语言知识整合中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20808 2026-03-24 cs.CV cs.LG 57%

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

预测正则化对抗多模态大语言模型中的视觉表征退化

Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan, Xinbin Yuan, Shouhong Ding, Xialei Liu, Ming-Ming Cheng

机构 * NKIARI VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) AAIS, Nankai University(AAIS,南开大学) Tencent Youtu Lab(腾讯优设实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20807 2026-03-24 cs.CL 57%

BenchBench: Benchmarking Automated Benchmark Generation

BenchBench:自动化基准生成的评估

Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI 57%

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10218 2026-03-24 cs.AR cs.LG 57%

ACE-RTL: When Agentic Context Evolution Meets RTL-Specialized LLMs

ACE-RTL:当代理上下文进化与专为RTL设计的LLM相遇

Chenhui Deng, Zhongzhi Yu, Guan-Ting Liu, Nathaniel Pinckney, Brucek Khailany, Haoxing Ren

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ACE-RTL结合代理上下文进化与专为RTL设计的LLM,通过生成器、反射器和协调器三部分提升RTL代码的正确性,实现41.02%的通过率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05824 2026-03-24 cs.CL 57%

Multi-Session Client-Centered Treatment Outcome Evaluation in Psychotherapy

多会话以客户为中心的治疗结果评估

Hongbin Na, Tao Shen, Shumao Yu, Ling Chen

机构 * Australian AI Institute, University of Technology Sydney, Australia(澳大利亚人工智能研究所,悉尼技术大学,澳大利亚) KU Leuven, Belgium(鲁汶大学,比利时)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出IPAEval框架,通过整合跨会话客户情境评估与会话聚焦客户动态评估,从客户视角自动化评估治疗结果,实验显示其在多会话跟踪症状严重度和治疗效果方面优于基线方法。

Comments Accepted at LREC 2026. Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20578 2026-03-24 cs.AI 57%

Context Cartography: Toward Structured Governance of Contextual Space in Large Language Model Systems

上下文制图:迈向大型语言模型系统中上下文空间的结构化治理

Zihua Wu, Georg Gartner

机构 * NVIDIA(英伟达) Research Division Cartography, TU Wien(地图研究部,维也纳技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Context Cartography框架,通过定义三区模型和七种制图操作,系统治理上下文空间的结构与信息流动,验证其在实际系统中的有效性。

Comments 31 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20260 2026-03-24 cs.AI 57%

ProMAS: Proactive Error Forecasting for Multi-Agent Systems Using Markov Transition Dynamics

ProMAS:利用马尔可夫转移动态进行多智能体系统的前瞻性错误预测

Xinkui Zhao, Sai Liu, Yifan Zhang, Qingyu Ma, Guanjie Cheng, Naibo Wang, Chang Liu

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ProMAS通过马尔可夫转移动态预测多智能体系统中的错误,采用因果delta特征捕捉语义位移,结合前瞻性预测头和跳跃检测,实现低延迟的错误定位,提升自主推理的实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19974 2026-03-23 cs.CR cs.AI 57%

Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance

Trojan's Whisper:通过注入的Bootstrap引导 stealthily操纵OpenClaw

Fazhong Liu, Zhuoyan Chen, Tu Lan, Haozhen Tan, Zhenyu Xu, Xiang Li, Guoxing Chen, Yan Meng, Haojin Zhu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过注入引导文件进行的隐蔽攻击,揭示了自主代理生态系统设计中的根本矛盾,强调了基于能力隔离、运行时策略执行和透明引导溯源的防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19935 2026-03-23 cs.LG 57%

Memori: A Persistent Memory Layer for Efficient, Context-Aware LLM Agents

Memori:一种高效的、基于上下文的LLM代理持久内存层

Luiz C. Borro, Luiz A. B. Macarini, Gordon Tindall, Michael Montero, Adam B. Struck

机构 * Memori Labs Inc.(Memori实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 Memori通过结构化表示替代大上下文窗口,实现高效、低成本的LLM代理部署,准确率达81.95%。

Comments 9 pages; 2 figures; white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24897 2026-03-23 cs.AI 57%

RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark

RealUnify: 统一模型真的能从统一中受益吗?一个全面的基准测试

Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu

机构 * PKU(北京大学) Kling Team(Kling团队) NTU(国立台湾大学) CASIA(中国科学院自动化研究所) NUS(国立新加坡大学) USTC(中国科学技术大学) THU(清华大学) ZJU(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RealUnify基准测试旨在评估统一模型中理解与生成能力的双向协同效应,通过10类32子任务的1000个人工标注实例,揭示现有统一模型在协同能力上的不足,强调需新的训练策略来提升统一建模潜力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19517 2026-03-23 cs.CV cs.LG 57%

ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding

ReXInTheWild:医疗照片理解的统一基准

Oishi Banerjee, Sung Eun Kim, Alexandra N. Willauer, Julius M. Kernbach, Abeer Rihan Alomaish, Reema Abdulwahab S. Alghamdi, Hassan Rayhan Alomaish, Mohammed Baharoon, Xiaoman Zhang, Julian Nicolas Acosta, Christine Zhou, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究所) Department of Medicine, Division of Gastroenterology, Massachusetts General Hospital(麻省总医院内科与消化内科部门) Department of Neuroradiology, Heidelberg University Hospital(海德堡大学医院神经放射科部门) King Abdulaziz Medical City, National Guard Health Affairs(国王阿卜杜勒-阿齐兹医疗城,国民守卫健康事务局) Division of Pulmonary, Critical Care, and Sleep Medicine, University of Cincinnati(辛辛那提大学肺科、重症医学及睡眠医学部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ReXInTheWild基准,通过484张医学文献来源的照片和7个临床主题的955个多项选择问题,评估视觉-语言模型对医疗照片内容的理解能力,揭示不同模型在细粒度图像理解和医学推理上的性能差异。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 57%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18729 2026-03-20 cs.AI 57%

Analysis Of Linguistic Stereotypes in Single and Multi-Agent Generative AI Architectures

单Agent和多Agent生成式AI架构中语言刻板印象的分析

Martina Ullasci, Marco Rondina, Riccardo Coppola, Flavio Giobergia, Riccardo Bellanca, Gabriele Mancari Pasi, Luca Prato, Federico Spinoso, Silvia Tagliente

机构 * Politecnico di Torino(托斯卡纳理工学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文分析了生成式AI在单Agent和多Agent架构中对不同方言的刻板印象生成,探讨了通过提示工程和多Agent架构缓解偏见的效果,发现不同模型在刻板印象表现上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18677 2026-03-20 cs.HC cs.AI cs.CY 57%

Cognitive Amplification vs Cognitive Delegation in Human-AI Systems: A Metric Framework

认知放大与认知委托在人机系统中的区别:一个度量框架

Eduardo Di Santi

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出度量框架区分认知放大与认知委托,通过定义CAI*、D、HRI和HCDR等指标,评估人机系统协同性能及人类认知可持续性。

Comments 16 pages, 2 figures. Conceptual and mathematical framework for human-AI collaboration, cognitive amplification, cognitive delegation, and cognitive sustainability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18508 2026-03-20 cs.CV cs.AI 57%

Foundations and Architectures of Artificial Intelligence for Motor Insurance

人工智能在机动车保险中的基础与架构

Teerapong Panboonyuen

机构 * Thaivivat Insurance Public Company Limited(泰维瓦特保险公共公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统阐述了机动车保险中人工智能的基础与架构,结合大规模实际应用,提出统一的垂直整合AI范式,整合感知、多模态推理和生产基础设施,实现汽车风险评估和理赔流程的端到端自动化。

Comments 173 pages

详情

展开后加载摘要…

URL PDF HTML 收藏