arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1017 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1017 篇

2508.08748 2026-08-19 cs.RO cs.AI 版本更新 57%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09025 2026-08-18 cs.AI cs.CR stat.ML 版本更新 57%

Context Is Not Authority: Structured Runtime Governance for Financial Market Agents

上下文并非权威:面向金融市场智能体的结构化运行时治理

Rui Tang, Qiangqiang Liu, Yichi Zhang, Youwei Yang, Xi Chen, Chen Dong

机构 * OpenAsk Binance(币安) New York University(纽约大学) Xiamen University(厦门大学) Bank of Hebei(河北银行)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 针对金融智能体可能将正确上下文转化为未经授权影响的问题,提出SAGE-Fin金融领域权限交接合约,通过运行时控制影响保障合规,经测试和实际部署验证了其有效性。

Comments 15 pages, 1 figure, 9 tables. Qiangqiang Liu and Yichi Zhang are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新 57%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 57%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 规划决策 :AI agent(abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20753 2026-08-18 physics.chem-ph cs.AI 版本更新 57%

Empowering Polymeric Materials Discovery by Artificial Intelligence

人工智能赋能高分子材料发现

Chenyao Ma, Linda Zhang, Yuheng Chen, Wei Du, Shangwen Fang, Zihao Jiang, Chuanyu Liu, Xinyu Ma, Rui Su, Gang Wang, Muyao Yu, Dong Zhong, Jie Zhu, Weibo Gong, Huan Gu, Limin Li, Chen Shen, Rui Wu, Zhenghao Wu, Kan Xu, Min Zhou, Donglin He, Xiayun Huang, Shan Jiang, Pengfei Ou, Jiayu Peng, Yuwei Zhang, Jie Zhao, Di Zhang, Piao Ma, Zhenghao Li, Hao Li

机构 * Suzhou MatSource Technology Co., Ltd.(苏州MatSource科技有限公司) Gusu Laboratory of Materials(材料Gusu实验室) Advanced Institute for Materials Research (WPI-AIMR)(先进材料研究所(WPI-AIMR)) Frontier Research Institute for Interdisciplinary Sciences (FRIS)(交叉学科前沿研究所(FRIS)) State Key Laboratory of Advanced Environmental Technology, Department of Environmental Science and Engineering, University of Science and Technology of China(先进技术国家实验室,环境科学与工程系,中国科学技术大学) Jiangsu Key Laboratory of New Power Batteries, Jiangsu Collaborative Innovation Centre of Biomedical Functional Materials, School of Chemistry and Materials Science, Nanjing Normal University(新型动力电池江苏省重点实验室,生物医学功能材料协同创新中心,化学与材料科学学院,南京师范大学) Department of Chemistry, National University of Singapore(新加坡国立大学化学系) Thrust of Sustainable Energy and Environment, The Hong Kong University of Science and Technology (Guangzhou)(可持续能源与环境方向,香港科技大学(广州)) Department of Materials Design and Innovation, University at Buffalo(材料设计与创新系,布法罗大学) College of Smart Materials and Future Energy, State Key Laboratory of Molecular Engineering of Polymers, Fudan University(智能材料与未来能源学院,聚合物分子工程国家重点实验室,复旦大学) School of Physical Science and Technology, Shanghai tech University(物理科学与技术学院,上海科技大学) The State Key Laboratory of Molecular Engineering of Polymers and Department of Macromolecular Science, Fudan University(聚合物分子工程国家重点实验室和大分子科学系,复旦大学) Department of Chemistry and Materials Science, Xi'an J Liverpool University(化学与材料科学系,西安J Liverpool大学)

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本文综述了数据基础设施、机器学习、大模型和实验室自动化如何融合成自主发现生态系统,通过自改进反馈循环实现高分子材料的预测性、可重复和可扩展创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08780 2026-08-18 cs.RO cs.LG 版本更新 57%

Morphology-Conditioned World Model for Cross-Embodiment Quadrupedal Locomotion

迈向基于形态条件的四足世界模型

Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于形态条件的四足世界模型,通过整合物理形态编码器和奖励归一化器,实现跨形态的零样本泛化,解决传统隐式系统识别的适应滞后问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18518 2026-08-18 cs.LG stat.ME stat.ML 版本更新 57%

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

利用机器学习辅助抽样和大语言模型标注测量违规内容的普及率

Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

机构 * Pinterest

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于机器学习和大语言模型的系统,用于高效测量违反政策内容的普及率,通过概率抽样和多模态标注提升测量准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 57%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11535 2026-08-18 cs.LG cs.HC math.OC 版本更新 57%

Balancing Optimality and Diversity: Human-Centered Decision Making through Generative Curation

平衡最优性与多样性:通过生成式策展实现以人为中心的决策

Michael Lingzhi Li, Shixiang Zhu

机构 * Technology and Operations Management, Harvard Business School(哈佛商学院技术与运营管理系) Heinz College of Information Systems and Public Policy, Carnegie Mellon University(卡内基梅隆大学海因兹学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究提出生成式策展框架,通过分解组合合意度、开发适配多行动空间的方法,在决策支持场景下大幅降低遗憾值,适用于警区重划等复杂运营规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11195 2026-08-17 cs.AI cs.CC cs.HC math.FA 版本更新 57%

Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration

格罗滕迪克常数的长周期AI研究:人机数学协作的案例研究

Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过案例探究AI在数学研究中的有效应用,利用AI研究系统将格罗滕迪克常数的最优界收紧,同时分析了AI用于数学研究的优劣势及相关经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 57%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08491 2026-08-17 cs.RO cs.AI cs.SY eess.SY 版本更新 57%

Edge Case Detection in Automated Driving: Methods, Challenges, and Future Directions

自动驾驶中的边缘案例检测:方法、挑战与未来方向

Saeed Rahmani, Sabine Rieder, Erwin de Gelder, Marcel Sonntag, Jorge Lorente Mallada, Sytze Kalisvaart, Vahid Hashemi, Bart van Arem, Simeon C. Calvert

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文针对自动驾驶边缘案例检测缺乏全面综述的问题,对相关方法分层分类,引入知识驱动方法,评估检测技术指标,指出数据、验证等挑战,为自动驾驶测试提供框架与实际测试支持。

Comments This article has been accepted for inclusion in a future issue of this journal. Content is final as presented, with the exception of pagination. doi: https://doi.org/10.1109/TITS.2026.3715674

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11110 2026-08-14 cs.CL 版本更新 57%

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

行动胜于言语:测量使用工具的智能体的跨语言策略保留率

Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

机构 * Microsoft Research India(微软研究院印度分部)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 该研究测量使用工具的智能体的跨语言行动策略保留率,发现前沿模型在贪心解码下保留71%-73%策略,参数低于100亿时保留率崩溃,且存在影响测量的混淆因素。

Comments Accepted in COLM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20781 2026-08-13 cs.AI cs.CY econ.GN q-fin.EC 版本更新 57%

The Human-AI Substitution Principle: When will you be replaced by AI in your organization?

人类-人工智能替代原则:在你的组织中,你何时会被人工智能取代?

Bonny Banerjee, Shreya Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究人类员工何时被人工智能取代,提出HAT分析模型,编码人类技能与人工智能能力的经济不对称,推导多因素对人机替代的影响,得出替代原则,揭示其引发的组织变化及中层管理与高技能工人的脆弱性,统一相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21112 2026-08-13 cs.CV cs.AI cs.RO 版本更新 57%

LiDAR-based 3D Change Detection at City Scale

基于LiDAR的城市级三维变化检测

Hezam Albaqami, Haitian Wang, Xinyu Wang, Muhammad Ibrahim, Zainy M. Malakan, Abdullah M. Algamdi, Mohammed H. Alghamdi, Ajmal Mian

机构 * Department of Computer Science and Artificial Intelligence, University of Jeddah(计算机科学与人工智能系,朱德亚大学) Department of Computer Science and Software Engineering, University of Western Australia(计算机科学与软件工程系,西澳大学) Department of Data Science, Umm Al-Qura University(数据科学系,乌姆·阿勒·卡拉大学) Department of Information and Technology Systems, College of Computer Science and Engineering, University of Jeddah(信息与技术系统系,计算机科学与工程学院,朱德亚大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于LiDAR的城市级三维变化检测方法,通过多分辨率NDT和ICP对齐数据,结合语义分割和双分匹配优化,实现了高精度的变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00945 2026-08-12 cs.LG cs.CY 版本更新 57%

TS-Mob: Social and Geographical-Aware Time Series Foundation-Model Framework for Human Mobility Prediction

TS-Mob:面向人类移动性预测的社交与地理感知时间序列基础模型框架

Massimiliano Luca, Ciro Beneduce, Bruno Lepri

机构 * MobS Lab, Bruno Kessler Foundation(布鲁诺·凯瑟林基金会移动实验室) Department of Computer Science, University of Trento(特伦托大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 TS-Mob框架通过结合地理社交信号与天气协变量微调TimesFM模型,在多类移动性预测基准上显著优于各类基线,且在不同时间区间表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00868 2026-08-11 physics.app-ph cond-mat.mtrl-sci cs.LG cs.SY eess.SY 版本更新 57%

Autonomous Reliability Qualification of Ga$_2$O$_3$-based diode sensors via Safe Active Learning

基于Ga₂O₃二极管传感器的自主可靠性认证:通过安全主动学习

Davi Febba, William A. Callahan, Anna Sacchi, Andriy Zakutayev

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究提出安全主动学习(SAL)框架,用于Ga₂O₃二极管传感器的自主可靠性表征,经仿真与实验验证后,其生成的数据集可支撑高斯过程模型实现长时退化预测,且该框架适用于其他器件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23290 2026-08-11 cs.AI 版本更新 57%

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理

Xi Chen, Hongru Zhou, Shiyu Feng, Hanyu Zhou, Huahui Yi, Rongsheng Wang, Tiancheng He, Kun Wang, Pingping Liu, Qiankun Li, Sicheng Lin, Huiying Ou, Xiaohong Zheng, Tianying Zang, Zhuohang Wu, Leheng Jiang, Kexin Cao, Wenhan Zhang, ChengYi Li, Zhiyang Wang, Songlin Li, Benyou Wang, Ningbei Yin, Shaoting Zhang, Weili Fu, Jian Li, Kang Li

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。

Comments 100 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18262 2026-08-11 cs.AI 版本更新 57%

ProbSPARQL: Querying Knowledge Graphs with Multi-dimensional, Uncertain Numeric Data

ProbSPARQL:使用多维不确定数值数据查询知识图谱

Jingcheng Wu, Ratan Bahadur Thapa, Daniel Hernandez, Hongkuan Zhou, Steffen Staab

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Bosch Corporate Research(博世企业研究部) Web and Internet Science Research Group, University of Southampton(南安普顿大学网络与互联网科学研究组)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对循环工厂中含多维不确定数值数据的知识图谱查询问题,提出ProbSPARQL,它将不确定数值建模为随机变量,支持相关表达式、过滤器和连接。通过实现和评估,展示了其在引擎内执行的可行性及相关性能优势。

Comments 18 pages, 5 figures, 1 table. Accepted at ISWC 2026, camera-ready version. Supplementary material and reproducibility artifacts are available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00941 2026-08-11 cs.LG cs.CV 版本更新 57%

Uncertainty in a Single Pass: A Closed-Form Identity for One-Step Flow Matching

散度即不确定性:流匹配的闭式后验协方差

Jiarui Xing, Song Wang, Jian Wang

机构 * Yale University(耶鲁大学) Shanxi University(山西大学) Harvard Medical School(哈佛医学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文通过扩展Tweedie公式到流匹配插值,推导出生成轨迹上每一点后验协方差的精确闭式表达式,该表达式仅依赖于学习速度场的散度,可在预训练模型上事后计算,无需重新训练或修改架构。

Comments 9 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03538 2026-08-11 cs.LG 版本更新 57%

Online Learnability of Chain-of-Thought Verifiers: Soundness and Completeness Trade-offs

链式思维验证器的在线可学习性:正确性与完备性的权衡

Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia, Zhiyuan Li, Dravyansh Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Northwestern University(西北大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种在线学习框架,用于学习链式思维验证器,通过检查解决方案的正确性,解决生成器与验证器之间的反馈循环导致的分布偏移问题,并引入新的Littlestone维度扩展以优化验证器的学习。

Comments The abstract has been abridged due to arXiv length constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08910 2026-08-11 cs.CL 版本更新 57%

SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation

SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Koehn

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。

Comments COLM 2026 (Conference on Language Modeling). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06473 2026-08-11 physics.soc-ph cs.AI cs.SI 版本更新 57%

Deep Generative Model for Human Mobility Behavior

人类移动行为的深度生成模型

Ye Hong, Yatao Zhang, Konrad Schindler, Martin Raubal

机构 * Institute of Cartography and Geoinformation, ETH Zurich(测绘与地理信息研究所,苏黎世联邦理工学院) Department of Human Geography, Lund University(人类地理学系,吕勒奥大学) Future Resilient Systems, Singapore-ETH Centre, ETH Zurich(未来韧性系统,新加坡-苏黎世联邦理工学院,苏黎世联邦理工学院) Photogrammetry and Remote Sensing, ETH Zurich(摄影测量与遥感,苏黎世联邦理工学院) Department of Geography, University College London(地理系,伦敦大学学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出基于扩散的生成框架MobilityGen,模拟多属性活动-出行序列,复现标度律、时间分配等关键模式,支持城市空间可达性和社会暴露分析。

Comments Accepted at TRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22966 2026-08-11 cs.CL 版本更新 57%

Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks

提示工程并不能普遍提升大型语言模型在临床决策任务中的性能

Mengdi Chai, Ali R. Zomorrodi

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 本研究发现提示工程对LLMs在临床决策任务中的性能提升具有高度依赖模型和任务的特性,强调了定制化策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09636 2026-08-11 cs.CL 版本更新 57%

MiraMind: Benchmarking Reliable Mental Health Reasoning beyond Answer Accuracy

MentraSuite:面向心理健康推理与评估的训练后大语言模型

Mengxi Xiao, Kailai Yang, Pengde Zhao, Enze Zhang, Ziyan Kuang, Zhiwei Liu, Weiguang Han, Shu Liao, Lianting Huang, Guojun Xiong, Victor Gutierrez Basulto, Jinpeng Hu, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心) The University of Manchester(曼彻斯特大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Mount Holyoke College(马歇尔学院) Hefei University of Technology(合肥工业大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 MentraSuite通过训练后模型Mindora,提升心理健康推理的可靠性与一致性,适用于复杂的心理健康评估与诊断场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27544 2026-08-11 cs.AI cs.FL 版本更新 57%

TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation

TempoBench:评估大语言模型中的时间因果推理

Nikolaus Holzer, William Fishell, Baishakhi Ray, Mark Santolucito

机构 * Columbia University(哥伦比亚大学) Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 57%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11868 2026-08-11 cs.CY cs.AI 版本更新 57%

Ethical Framework for Responsible Foundational Models in Medical Imaging

医学影像领域负责任基础模型的伦理框架

Debesh Jha, Gorkem Durak, Abhijit Das, Jasmer Sanjotra, Onkar Susladkar, Suramyaa Sarkar, Ashish Rauniyar, Nikhil Kumar Tomar, Linkai Peng, Sirui Li, Koushik Biswas, Ertugrul Aktas, Elif Keles, Matthew Antalek, Zheyuan Zhang, Bin Wang, Xin Zhu, Hongyi Pan, Deniz Seyithanoglu, Alpay Medetalibeyoglu, Vanshali Sharma, Vedat Cicek, Amir A. Rahsepar, Rutger Hendrix, A. Enis Cetin, Bulent Aydogan, Mohamed Abazeed, Frank H. Miller, Rajesh N. Keswani, Hatice Savas, Sachin Jambawalikar, Daniela P. Ladner, Amir A. Borhani, Concetto Spampinato, Michael B. Wallace, Ulas Bagci

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究针对医学影像领域基础模型整合临床实践时的隐私、偏差、可解释性等伦理挑战,提出含隐私保护、偏差应对、人类监督的伦理框架,以平衡创新与医学伦理原则。

Journal ref https://www.frontiersin.org/journals/medicine/articles/10.3389/fmed.2025.1544501/full

详情

展开后加载摘要…

URL PDF HTML 收藏