arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 455 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 79 篇

2602.08057 2026-02-10 cs.CV cs.AI 57%

Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks

弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略

Yufei Wang, Haixu Liu, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing

机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) Shandong University of Technology, Beijing, China(山东理工大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07773 2026-02-10 cs.CL cs.IR 57%

SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents

SRR-Judge: 逐步评分与细化以增强搜索集成推理在搜索代理中的能力

Chen Zhang, Kuicai Dong, Dexun Li, Wenjun Li, Qu Yang, Wei Han, Yong Liu

机构 * Huawei Technologies(华为技术)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 SRR-Judge通过逐步评分与细化提升搜索代理的搜索集成推理能力,通过迭代拒绝采样微调实现更可靠的评估和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07559 2026-02-10 cs.AI cs.CC cs.NA math.NA 57%

VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning

VERIFY-RL: 在数学推理中用于强化学习的可验证递归分解

Kaleem Ullah Qasim, Jiashu Zhang, Hao Li, Muhammad Kafeel Shaheen

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Verify-RL通过可验证的递归分解提升数学推理强化学习的准确性和稳定性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02206 2026-02-10 cs.LG 57%

Fat-Cat: Document-Driven Metacognitive Multi-Agent System for Complex Reasoning

Fat-Cat:面向复杂推理的文档驱动元认知多智能体系统

Tong Yang, Yemin Wang, Chaoning Zhang, Aming Wu

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 Fat-Cat通过文档驱动的智能体架构提升复杂推理性能,利用语义文件系统和文本策略进化模块,使Kimi-k2在HotPotQA中超越GPT-4o基线。

Comments This submission is withdrawn due to errors in the manuscript content and inaccuracies in the author information. The authors plan to correct these issues and may submit a revised version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18715 2026-02-10 cs.AI 57%

HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions

HuggingR$^{4}$: 一种用于发现最优模型伙伴的渐进推理框架

Shaoyin Ma, Chenggong Hu, Huiqiong Wang, Li Sun, Mingli Song, Jie Song

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 HuggingR$^4$通过渐进推理框架提升模型选择效率,实现更高的可行性与合理性,同时降低token消耗。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 57%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07082 2026-02-10 cs.CV cs.AI 57%

MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation

MosaicThinker: 通过迭代构建空间表示实现设备端具身AI的视觉空间推理

Haoming Wang, Qiyao Xue, Weichen Liu, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 MosaicThinker通过迭代构建空间表示,提升设备端具身AI在复杂跨帧空间推理任务中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05342 2026-02-10 cs.RO cs.AI 57%

Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control

信息论图融合:基于视觉-语言-动作模型的政策推理与双臂机器人控制

Shunlei Li, Longsen Gao, Jin Wang, Chang Che, Xi Xiao, Jiuwen Cao, Yingbai Hu, Hamid Reza Karimi

机构 * Electrical and Computer Engineering Department, University of New Mexico, Albuquerque, United States, 87106(电气与计算机工程系,新墨西哥大学,阿尔伯克基,美国,87106) Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford, United Kingdom, OX26NN(动态机器人系统组,牛津机器人研究所,牛津大学,英国,OX26NN) Mechanical and Aerospace Engineering Department, The George Washington University, DC, United States, 22202(机械与航空航天工程系,乔治华盛顿大学,华盛顿特区,美国,22202) Department of Computer Science, University of Alabama at Birmingham, Alabama, United States, 35294(计算机科学系,阿拉巴马大学伯明翰分校,阿拉巴马,美国,35294) The School of Computation, Information and Technology, Technical University of Munich, Germany, 85748(计算、信息与技术学院,慕尼黑技术大学,德国,85748) Department of Mechanical Engineering, Politecnico di Milano, Milan, Italy, 20156(机械工程系,米兰理工学院,米兰,意大利,20156)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 GF-VLA通过信息论图融合视觉-语言-动作模型,实现双臂机器人任务推理与执行,提升空间泛化与任务成功率。

Comments Journal accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08537 2026-02-10 cs.RO 50%

UniPlan: Vision-Language Task Planning for Mobile Manipulation with Unified PDDL Formulation

UniPlan: 为移动操作统一PDDL形式的视觉-语言任务规划

Haoming Ye, Yunxiao Xiao, Cewu Lu, Panpan Cai

专题命中 推理与问题求解 :LLM(abstract)

AI总结 UniPlan通过统一PDDL形式实现视觉-语言任务规划,提升大规模室内移动操作的规划效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07845 2026-02-10 cs.RO 50%

Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning

递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展

Yalcin Tur, Jalal Naghiyev, Haoquan Fang, Wei-Chuan Tsai, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * Stanford University(斯坦福大学) Technical University of Munich(慕尼黑技术大学) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。

Comments 11 Pages, Project page:https://rd-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05721 2026-02-10 cs.SE 50%

A Dual-Loop Agent Framework for Automated Vulnerability Reproduction

面向自动化漏洞复现的双环代理框架

Bin Liu, Yanjie Zhao, Zhenpeng Chen, Guoai Xu, Haoyu Wang

专题命中 推理与问题求解 :LLM(abstract)

AI总结 CVE2PoC通过双环代理框架实现漏洞复现自动化,提升漏洞利用代码的生成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12081 2026-02-10 cs.CV 50%

VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning

VisionReasoner: 通过强化学习实现统一的推理集成视觉感知

Yuqi Liu, Tianyuan Qu, Zhisheng Zhong, Bohao Peng, Shu Liu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) SmartMore(SmartMore公司) HKUST(香港理工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 VisionReasoner通过强化学习实现统一的推理集成视觉感知,其在检测、分割和计数任务中均取得优于基线模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 103 篇

2601.22636 2026-02-10 cs.AI 90%

Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling

在最佳-N采样下对大语言模型中的对抗风险进行统计估计

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Chenliang Xu, Christopher White, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究提出SABER方法,通过Beta分布建模样本成功概率,利用解析缩放定律预测大规模对抗风险,显著降低估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08266 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.IR 90%

Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants

对殖民弗吉尼亚土地授予进行大规模语言模型评估

Ryan Mioduski

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了大规模语言模型在将殖民弗吉尼亚土地授予描述转换为地理坐标方面的性能,发现模型在准确性与成本效益上表现优异。

Journal ref Journal of Spatial Information Science, No. 31 (2025), pp. 57-96

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07904 2026-02-10 cs.LG cs.AI 90%

Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models

基于大语言模型的贝叶斯优化自适应获取选择

Giang Ngo, Dat Phan Trong, Dang Nguyen, Sunil Gupta, Svetha Venkatesh

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(德肯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LMABO框架,利用预训练大语言模型作为自适应策略,通过结构化状态表示选择最优获取函数,提升贝叶斯优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11090 2026-02-10 cs.CL cs.AI 90%

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

SafeDialBench: 一种用于多轮对话中大型语言模型安全评估的细粒度基准,针对多样化对抗攻击

Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Boyan Wang, Jiaheng Liu, Tianpei Yang, Jing Huo, Yang Gao, Fanyu Meng, Xi Yang, Chao Deng, Junlan Feng

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Research Institute(中国移动研究院) China Mobile (Suzhou) Software Technology Co., Ltd(中国移动苏州软件技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SafeDialBench提出了一种细粒度基准,用于评估大型语言模型在多轮对话中面对多样化对抗攻击时的安全性,通过多维度分类和对抗攻击策略提升评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12144 2026-02-10 cs.CL cs.AI 90%

Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models

基于大语言模型的人格情境判断测试自动题目生成

Chang-Jin Li, Jiyuan Zhang, Yun Tang, Jian Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大语言模型开发自动生成人格情境判断测试的框架,通过三项实验验证了其在内容效度、可重复性和心理测量特性上的有效性。

Comments Accepted by Computers in Human Behavior Reports. The supplementary materials, data, and items are available at https://osf.io/jbvq7/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05656 2026-02-10 cs.LG cs.AI 90%

Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation

大语言模型对齐的可验证性:行为评估下的规范不可区分性

Igor Santos-Grueiro

机构 * Igor Santos-Grueiro(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。

Comments 10 pages. Theoretical analysis of behavioral alignment evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08889 2026-02-10 cs.AI 89%

Scalable Delphi: Large Language Models for Structured Risk Estimation

可扩展的德尔菲:用于结构化风险估计的大型语言模型

Tobias Lorenz, Mario Fritz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出可扩展的德尔菲方法,利用大型语言模型进行结构化风险评估,通过多样化的专家人设和迭代优化,实现了高效且准确的风险估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08887 2026-02-10 cs.SE cs.AI 89%

DeepQuali: Initial results of a study on the use of large language models for assessing the quality of user stories

DeepQuali: 大型语言模型在评估用户故事质量研究中的初步结果

Adam Trendowicz, Daniel Seifert, Andreas Jedlitschka, Marcus Ciolkowski, Anton Strahilov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DeepQuali利用大型语言模型评估用户故事质量,通过对比专家判断发现其在整体评估上有效,但细节评分存在分歧,且需进一步融入工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08872 2026-02-10 cs.CL cs.IR 89%

Large Language Models for Geolocation Extraction in Humanitarian Crisis Response

大型语言模型在人道主义危机响应中的地理信息提取

G. Cafferata, T. Demarco, K. Kalimeri, Y. Mejova, M. G. Beiró

机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08192 2026-02-10 cs.SE 89%

Adoption of Large Language Models in Scrum Management: Insights from Brazilian Practitioners

大语言模型在Scrum管理中的应用:来自巴西实践者的洞察

Mirko Perkusich, Danyllo Albuquerque, Allysson Allex Araújo, Matheus Paixão, Rohit Gheyi, Marcos Kalinowski, Angelo Perkusich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了大语言模型在Scrum管理中的应用,发现其在提升生产率和减少手动工作方面有显著益处,但同时也面临输出准确性和保密性等风险。

Comments Accepted for publication at the 27th International Conference on Agile Software Development (XP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03444 2026-02-10 cs.CL cs.AI 88%

Taxation Perspectives from Large Language Models: A Case Study on Additional Tax Penalties

大语言模型的税收视角:关于附加税收罚金的案例研究

Eunkyung Choi, Youngjin Suh, Siun Lee, Hongseok Oh, Juheon Kang, Won Hur, Hun Park, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在税收领域的能力,通过PLAT基准测试发现其在复杂法律推理任务中表现有限。

Comments 9 pages

Journal ref EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13240 2026-02-10 cs.LG 88%

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07079 2026-02-10 cs.SE cs.CL 88%

Comprehensive Evaluation of Large Language Models on Software Engineering Tasks: A Multi-Task Benchmark

对大型语言模型在软件工程任务中的综合评估:一个多任务基准测试

Go Frendi Gunawan, Mukhlis Amien

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了11种先进LLMs在五个软件工程任务中的表现,发现模型在完成时间、工具效率和成本上存在显著差异,同时揭示了两种低效模式,并展示了编码任务的成功率与研究任务的挑战性差异。

Comments 10 pages, 7 figures. Under review. Code and data will be fully released

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11341 2026-02-10 cs.CV 88%

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

InternSVG:通过多模态大语言模型实现统一的SVG任务

Haomin Wang, Jinhui Yin, Qi Wei, Wenguang Zeng, Lixin Gu, Shenglong Ye, Zhangwei Gao, Yaohui Wang, Yanting Zhang, Yuanqi Li, Yanwen Guo, Wenhai Wang, Kai Chen, Yu Qiao, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01474 2026-02-10 cs.AI 87%

AIReg-Bench: Benchmarking Language Models That Assess AI Regulation Compliance

AIReg-Bench: 用于评估AI监管合规性的语言模型基准测试

Bill Marino, Rosco Hunter, Christoph Schnabl, Zubair Jamali, Marinos Emmanouil Kalpakos, Mudra Kashyap, Isaiah Hinton, Alexa Hanson, Maahum Nazir, Felix Steffek, Hongkai Wen, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) University of Warwick(沃里克大学) University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 AIReg-Bench是一个用于评估语言模型在AI监管合规性评估方面性能的基准数据集,通过生成虚构AI系统样本并由法律专家标注,为LLM的合规性评估提供测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07238 2026-02-10 cs.AI cs.LG econ.GN q-fin.EC 87%

Is there "Secret Sauce'' in Large Language Model Development?

大型语言模型开发中是否存在'秘密配方'?

Matthias Mertens, Natalia Fischl-Lanzoni, Neil Thompson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大型语言模型的前沿进展主要由计算量驱动,而非专有技术,但非前沿领域中专有技术可显著降低计算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 87%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07275 2026-02-10 cs.NE 87%

Evolving LLM-Derived Control Policies for Residential EV Charging and Vehicle-to-Grid Energy Optimization

进化LLM衍生的控制策略用于住宅电动车充电和车辆到电网能源优化

Vishesh Purnananda, Benjamin John Wruck, Mingyu Guo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究利用LLM驱动的进化计算生成透明且可检查的电动车充电控制策略,通过混合提示策略实现118%的利润提升,发现复杂行为如前瞻性套利。

详情

展开后加载摘要…

URL PDF HTML 收藏