arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-15 至 2026-01-15 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2601.08848 2026-01-15 cs.CL cs.AI 84%

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

PediaMind-R1: 一种基于气质的个性化婴幼儿护理推理语言模型:通过认知建模与偏好对齐

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng

机构 * School of Future Information and Innovation, Fudan University(未来信息与创新学院,复旦大学) Corporate Research, Bosch (China) Investment Ltd.(博世(中国)投资有限公司研发部)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PediaMind-R1通过整合认知建模与偏好对齐,实现基于婴幼儿气质的个性化护理推理。

Comments Accepted at EMNLP 2025 PALS Workshop (PALS: EXPLORING ACTIVE AND PASSIVE LLM PERSONALIZATION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24952 2026-01-15 cs.CV 82%

Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning

超越最后一帧:面向生成视频推理的过程感知评估

Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Wayne Xin Zhao, Minghui Qiu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Information, Renmin University of China(中国人民大学信息学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出VIPER基准和POC@r指标,用于评估生成视频推理中过程与结果的一致性,揭示现有模型在推理能力上的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 81%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09459 2026-01-15 cs.IR cs.CL 79%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08988 2026-01-15 cs.AI 79%

ART: Action-based Reasoning Task Benchmarking for Medical AI Agents

ART:面向医疗AI代理的基于动作的推理任务基准测试

Ananya Mantravadi, Shivali Dalmia, Abhishek Mukherji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ART通过挖掘真实EHR数据创建挑战性任务,评估医疗AI代理在阈值评估、时间聚合和条件逻辑方面的表现,揭示其推理弱点,推动更可靠的临床决策支持系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09367 2026-01-15 cs.CL 77%

Relation Extraction Capabilities of LLMs on Clinical Text: A Bilingual Evaluation for English and Turkish

大型语言模型在临床文本中关系抽取能力的评估:英语和土耳其语的双语评估

Aidana Aidynkyzy, Oğuz Dikenelli, Oylum Alatlı, Şebnem Bora

机构 * Department of Computer Engineering, Astana IT University(阿斯塔纳IT大学计算机工程系) Department of Computer Engineering, Ege University(埃兹尔大学计算机工程系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究通过双语评估揭示了LLM在临床文本关系抽取中的能力,提出Relation-Aware Retrieval方法,展示其在英语和土耳其语中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17200 2026-01-15 cs.AI 70%

Large Language Model-Based Automatic Formulation for Stochastic Optimization Models

基于大语言模型的随机优化模型自动建模

Amirreza Talebi

机构 * Department of Integrated Systems Engineering(集成系统工程系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型通过结构化提示自动建模随机优化问题,引入软评分度量提升模型质量,展示LLMs在SO建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08942 2026-01-15 cs.CL 70%

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

SOP-Maze:在复杂业务标准操作规程上评估大语言模型

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

机构 * Meituan M17(美团M17) Georgia Institute of Technology(佐治亚理工学院) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 SOP-Maze通过评估大语言模型在复杂业务标准操作规程中的表现,揭示了模型在遵循规程、对话处理和计算推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06821 2026-01-15 cs.CL cs.AI cs.SE 62%

Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems

LLMs能否生成可靠的测试用例生成器?对竞赛级编程问题的研究

Yuhan Cao, Zian Chen, Kun Quan, Ziliang Zhang, Yu Wang, Xiaoning Dong, Yeqi Feng, Guanzhong He, Jingcheng Huang, Jianhao Li, Yixuan Tan, Jiafu Tang, Yilin Tang, Junlei Wu, Qianyu Xiao, Can Zheng, Shouchen Zhou, Yuxiang Zhu, Yiming Huang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) Fuzhou University(福州大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在生成竞赛级编程问题测试用例生成器方面的能力,提出TCGBench基准测试,并通过实验发现LLMs在生成针对性测试用例以暴露代码缺陷方面存在不足。

Comments 37 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09089 2026-01-15 cs.CL cs.AI 62%

SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding

SubTokenTest: 一个用于现实世界子token理解的实用基准

Shuyang Hou, Yi Hu, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SubTokenTest通过实用任务评估大语言模型在子token理解上的能力,揭示分词过程对性能的影响,并分析字符级信息的编码方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09066 2026-01-15 cs.CL cs.AI 62%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI 57%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05755 2026-01-15 cs.CR cs.AI 57%

VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit

VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击

Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) North Automatic Control Technology Research Institute(北自动控制技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09136 2026-01-15 cs.CV cs.AI 57%

SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL

SkinFlow: 通过动态视觉编码和分阶段强化学习实现开放性皮肤病诊断的高效信息传输

Lijun Liu, Linwei Chen, Zhishou Zhang, Meng Tian, Hengfu Cui, Ruiyang Li, Zhaocheng Liu, Qiang Ju, Qianxi Li, Hong-Yu Zhou

机构 * Baichuan Inc.(百川公司) Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科) Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室) National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心) NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室) School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院) University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SkinFlow通过动态视觉编码和分阶段强化学习提升皮肤病诊断效率,实现比通用模型更优的准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09130 2026-01-15 eess.IV cs.AI cs.CV 57%

Equi-ViT: Rotational Equivariant Vision Transformer for Robust Histopathology Analysis

Equi-ViT:用于鲁棒病理学分析的旋转等变视觉变换器

Fuyao Chen, Yuexi Du, Elèonore V. Lieffrig, Nicha C. Dvornek, John A. Onofrey

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Equi-ViT通过引入等变卷积核提升ViT在病理学图像中的旋转鲁棒性和数据效率。

Comments Accepted by IEEE ISBI 2026 4-page paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09036 2026-01-15 cs.CL cs.IR 57%

SpectraQuery: A Hybrid Retrieval-Augmented Conversational Assistant for Battery Science

SpectraQuery: 一种用于电池科学的混合检索增强型对话助手

Sreya Vangara, Jagjit Nanda, Yan-Kai Tzeng, Eric Darve

机构 * Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Applied Energy Division, SLAC National Accelerator Laboratory(SLAC国家加速器实验室应用能源部门) Institute of Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SpectraQuery通过结合结构化数据库和文献语料库,为电池科学提供检索增强型对话助手,有效整合数值证据与机理解释,提升科学推理效率。

Comments 11 pages, 8 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 57%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07309 2026-01-15 cs.CL 57%

Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain

Agent Bain vs. Agent McKinsey:业务领域的新文本到SQL基准测试

Yue Li, Ran Tao, Derek Hommel, Yusuf Denizay Dönder, Sungyong Chang, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学) Gena AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CORGI是一个新的文本到SQL基准测试,旨在评估业务领域中更复杂的问题,如预测和推荐,揭示LLM在处理复杂任务时的性能下降。

Comments 23 pages, under review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09216 2026-01-15 cs.DB 50%

Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions

面向数字精神科问诊医生-患者交互的诚实意识多智能体框架:高保真合成数据生成

Xinyuan Zhang, Zijian Wang, Chang Dao, Juexiao Zhou

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本研究提出一种多智能体框架,通过建模患者欺骗行为生成高保真合成数据,用于研究精神科评估中的诚实意识及训练适应性对话代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 50%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2601.08846 2026-01-15 cs.CL cs.AI cs.LG 82%

Directional Attractors in LLM Reasoning: How Similarity Retrieval Steers Iterative Summarization Based Reasoning

方向性吸引子在LLM推理中的作用:相似性检索如何引导迭代摘要推理

Cagatay Tekin, Charbel Barakat, Luis Joseph Luna Limgenco

机构 * McGill University(麦吉尔大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InftyThink与跨链记忆,通过语义引理检索提升LLM在结构化领域推理准确性,同时揭示异构领域中的失败模式及方向性偏见影响。

Comments 6 pages, 2 figures. Code available at: github.com/cagopat/InftyThink-with-Cross-Chain-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03697 2026-01-15 cs.LG cs.AI cs.AR 81%

AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing

AnaFlow: 基于代理的LLM工作流:以推理驱动的可解释且样本高效的模拟电路尺寸设计

Mohsen Ahmadzadeh, Kaichang Chen, Georges Gielen

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 AnaFlow通过基于代理的LLM工作流实现高效、可解释的模拟电路尺寸设计,利用人类可理解的推理和自适应仿真策略,提升设计效率和透明度。

Comments This article was accepted by 2025 International Conference on Computer-Aided Design (ICCAD 2025) and was presented in Munich, October 2025

Journal ref Proc. 2025 IEEE/ACM International Conference on Computer-Aided Design (ICCAD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09280 2026-01-15 cs.CL cs.AI 81%

ReGraM: Region-First Knowledge Graph Reasoning for Medical Question Answering

ReGraM:面向医疗问答的区域优先知识图谱推理

Chaerin Lee, Sohee Park, Hyunsik Na, Daseon Choi

机构 * Department of Software, Soongsil University(软件系,顺斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReGraM通过区域优先的知识图谱推理框架,提升医疗问答的准确性和一致性。

Comments 18 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08873 2026-01-15 cs.CV cs.AI cs.LG cs.MM 81%

ForensicFormer: Hierarchical Multi-Scale Reasoning for Cross-Domain Image Forgery Detection

ForensicFormer: 基于层次多尺度推理的跨领域图像伪造检测

Hema Hariharan Samson

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ForensicFormer通过层次多尺度推理框架,实现跨领域图像伪造检测的高准确率与鲁棒性,显著提升对AI生成图像的检测能力。

Comments 9 pages, 4 figures, 5 tables. Technical report on hierarchical multi-scale image forgery detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13477 2026-01-15 cs.HC cs.AI 79%

Creating 'Full-Stack' Hybrid Reasoning Systems that Prioritize and Enhance Human Intelligence

构建优先并增强人类智能的'全栈'混合推理系统

Sean Koon

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出通过生成式AI工具增强人类推理能力,构建优先考虑人类智能的混合系统,以应对未来挑战。

Comments 10 pages; 3 figures; 1 table Undergoing significant revision post-peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15530 2026-01-15 cs.HC cs.AI 79%

A Beautiful Mind: Principles and Strategies for AI-Augmented Human Reasoning

美丽的心灵:AI增强人类推理的原则与策略

Sean Koon

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种以人类为中心的AI增强推理范式,通过确立基本原则、提出多项任务多项工具的方法,并提供交互模式示例,旨在增强人类在人机交互中的主导地位。

Comments The content of this paper will be superseded by future works

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06416 2026-01-15 cs.AI cs.HC 70%

Advancing AI Negotiations: A Large-Scale Autonomous Negotiation Competition

推进人工智能谈判:大规模自主谈判竞赛

Michelle Vaccaro, Michael Caosun, Harang Ju, Sinan Aral, Jared R. Curhan

机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08844 2026-01-15 cs.CL cs.AI cs.CY cs.LG 67%

Emissions and Performance Trade-off Between Small and Large Language Models

小型与大型语言模型之间排放与性能的权衡

Anandita Garg, Uma Gaba, Deepan Muthirayan, Anish Roy Chowdhury

机构 * School of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Plaksha University(普拉克斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过比较LLMs与微调SLMs在自然语言处理、推理和编程任务中的性能与排放权衡,证明小型模型在减少碳排放的同时能保持相近的性能表现。

Comments 6 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06457 2026-01-15 cs.CR cs.AI cs.CL cs.MA 62%

ScamAgents: How AI Agents Can Simulate Human-Level Scam Calls

ScamAgents: 人工智能代理如何模拟人类水平的诈骗电话

Sanket Badhe

机构 * Rutgers University(罗格斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScamAgent,一种基于LLM的多轮代理,能生成逼真诈骗电话脚本并模拟欺诈场景,揭示现有安全机制对代理威胁的不足,呼吁加强多轮安全审计和检测生成AI驱动的对话欺骗。

Comments Accepted at CAMLIS 25: Conference on Applied Machine Learning for Information Security. 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19828 2026-01-15 cs.CL cs.MA 57%

Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

Memory-R1: 通过强化学习增强大语言模型代理以管理并利用记忆

Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, Yunpu Ma

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) University of Cambridge(剑桥大学) University of Hong Kong(香港大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Memory-R1通过强化学习框架,使大语言模型具备主动管理与利用外部记忆的能力,有效提升长跨度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏