arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-30 至 2025-12-30 共收录 138 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 26 篇

2512.22154 2025-12-30 cs.CR cs.AI cs.MA 70%

Practical challenges of control monitoring in frontier AI deployments

前沿AI部署中的控制监控实际挑战

David Lindner, Charlie Griffin, Tomek Korbak, Roland S. Zimmermann, Geoffrey Irving, Sebastian Farquhar, Alan Cooney

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了前沿AI部署中控制监控面临的实际挑战,分析了同步、半同步和异步监控方案,并通过案例研究探讨了监督、延迟和恢复等关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15044 2025-12-30 eess.SP 67%

Signal Whisperers: Enhancing Wireless Reception Using DRL-Guided Reflector Arrays

信号窃听者:利用DRL引导的反射阵列增强无线接收

Hieu Le, Oguz Bedir, Mostafa Ibrahim, Jian Tao, Sabit Ekin

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出基于DRL的反射阵列控制方法,通过多智能体强化学习提升非视线场景下的无线信号接收性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22721 2025-12-30 cs.NI cs.GT 67%

Cyber Resilience in Next-Generation Networks: Threat Landscape, Theoretical Foundations, and Design Paradigms

下一代网络中的网络韧性:威胁图景、理论基础与设计范式

Junaid Farooq, Quanyan Zhu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本书探讨下一代网络中网络韧性的重新概念化与工程化,通过零信任架构、博弈论威胁建模和AI技术,应对复杂威胁挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22218 2025-12-30 cs.CV cs.MM 67%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05407 2025-12-30 cs.LG cs.AI stat.ML 62%

Dictionary Learning: The Complexity of Learning Sparse Superposed Features with Feedback

字典学习:通过反馈学习稀疏叠加特征的复杂性

Akash Kumar

机构 * Department of Computer Science \& Engineering, University of California, San Diego, USA

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过反馈机制,研究在稀疏设置下学习字典特征的复杂性,并验证了理论结果在特征恢复和字典提取中的有效性。

Comments ICML'25, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 57%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23312 2025-12-30 cs.RO cs.AI 57%

Explainable Neural Inverse Kinematics for Obstacle-Aware Robotic Manipulation: A Comparative Analysis of IKNet Variants

可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析

Sheng-Kai Chen, Yi-Ling Tsai, Chun-Chih Chang, Yan-Chen Chen, Po-Chiang Lin

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21420 2025-12-30 cs.AI 57%

Feasible strategies in three-way conflict analysis with three-valued ratings

三值评分下的三方面冲突分析可行策略

Jing Liu, Mengjun Hu, Guangming Lang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering(湖南省工程数学建模与分析重点实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于一致性和不一致性度量的三值评分冲突分析方法,通过计算代理团评分和加权度量,系统识别可行策略和最优解,优于现有方法。

Journal ref International Journal of Approximate Reasoning 185, 109516, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23702 2025-12-30 quant-ph gr-qc 50%

The operational no-signalling constraints and their implications

可操作的无信号约束及其影响

Michał Eckstein, Tomasz Miller, Ryszard Horodecki, Ravishankar Ramanathan, Paweł Horodecki

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种统一框架,研究相对论时空中的非局部和时间相关性,探讨了无信号约束的违反及其对因果循环和超光速信号的反驳。

Comments Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23373 2025-12-30 cs.CY 50%

Identifying Barriers Hindering the Acceptance of Generative AI as a Work Associate, measured with the new AGAWA scale

识别阻碍生成式人工智能作为工作同事接受度的障碍,使用新的AGAWA量表

Łukasz Sikorski, Albert Łukasik, Jacek Matulewski, Arkadiusz Gut

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AGAWA量表,用于测量学生对生成式人工智能作为工作同事的态度,发现积极态度与三个因素呈负相关,且因素间呈正相关,揭示了信任与职场AI态度的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV 50%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :planning(abstract)

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23115 2025-12-30 math.OC 50%

The Design of Optimal Dependency and Rewards

最优依赖与报酬的设计

Eilon Solan, Avraham Tabbach, Chang Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在两期委托-代理模型中,预算约束下通过最优报酬方案和成本相关结构设计提升代理表现的机制,发现低预算时应采用充分表现目标,高预算时应采用持续表现目标,负成本相关性在两者中均有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22873 2025-12-30 cs.GT 50%

Facility Location Games for Multi-Location Agents with Satisfaction

多地点代理的设施选址游戏

Huanjun Wang, Qizhi Fang, Wenjing Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了多地点代理的设施选址游戏,设计了群体策略证明机制以最大化满足度总和或最小值,同时保证代理真实报告位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03318 2025-12-30 math.OC math.PR 50%

Linear-quadratic optimal control for non-exchangeable mean-field SDEs and applications to systemic risk

线性二次最优控制用于非交换型均场随机微分方程及其在系统风险中的应用

Anna de Crescenzo, Filippo de Feo, Huyên Pham

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种用于非交换型均场随机微分方程的线性二次最优控制方法,并应用于系统风险模型,探讨了代理人异质性对风险缓解策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22475 2025-12-30 cs.DS cs.GT 50%

Beyond Exact Fairness: Envy-Free Incomplete Connected Fair Division

超越精确公平:无嫉妒不完全连通公平分配

Ajaykrishnan E S, Daniel Lokshtanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种高效参数化近似方案,解决无嫉妒不完全连通公平分配问题,在容忍轻微嫉妒的情况下实现高效计算。

Comments Published at FSTTCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22269 2025-12-30 cond-mat.mtrl-sci physics.app-ph physics.chem-ph 50%

Toward reducing the formation temperature of diopside via wet-chemical synthesis routes using chloride precursors

通过使用氯化前驱体的湿化学合成路线降低斜方辉石的形成温度

N. Namvar, E. Salahinejad, A. Saberi, M. J. Baghjeghaz, L. Tayebi, D. Vashaee

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过使用氯化前驱体的湿化学合成路线,探索了降低斜方辉石形成温度的方法,比较了不同合成工艺对晶体结构和均匀性的影响,发现共沉淀法能有效在低温下制备纳米斜方辉石。

Journal ref Ceramics International, 43 (2017) 13781-13785

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 50%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏