---
格式版本: 2
标题: "Agent vs 人类：到底是谁在“已读乱回”？ | arXiv每周论文推荐"
原文链接: "http://mp.weixin.qq.com/s?__biz=Mzg2MzgwNzE4Mw==&mid=2247530765&idx=1&sn=0fe65a5c7cec1e1b98cd79daaeaa846b&chksm=cfad5ae8e3d446331f4ac992ba7262268fbde247d8a1ddc3bf094f53f99fd99c5a3b9b0919c4&scene=126&sessionid=0#rd"
发布日期: "未标注"
发现时间: "2026-07-04T12:30:33+08:00"
入库时间: "2026-07-04T04:30:52.931Z"
来源平台: "次幂公众号"
搜索渠道: "cimidata_wechat"
搜索词: "黄大年茶思屋科技网站"
匹配关键词:
  - "测试"
相关厂家:
  - "Google"
相关专家:
  []
内容类型: "公众号"
抓取工具: "次幂公众号详情"
清洗工具: "次幂 HTML 转 Markdown + LLM 正文裁剪"
原始附件:
  []
AI优质: "否"
AI打分: 9
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "内容为通用AI论文推荐，完全未涉及超节点、AI Rack、机柜级AI基础设施、供电、散热、高速互连或量产落地等主题，与项目关注范围无关。"
AI质检模型: "deepseek-v4-flash"
AI质检时间: "2026-07-30T01:12:24+08:00"
AI主题相关性: 0
AI来源权威性: 2
AI新颖性: 2
AI技术细节: 0
AI商业部署信号: 0
AI完整性: 5
采集批次: "2026年7月4日12点30分29秒"
采集批次ID: "20260704-123029-291"
去重键: "http://mp.weixin.qq.com/s?__biz=Mzg2MzgwNzE4Mw%3D%3D&idx=1&mid=2247530765&sn=0fe65a5c7cec1e1b98cd79daaeaa846b"
---

![图片](./assets/img-f78ef49a.png)

【编者按】

“这周有什么最新的论文值得一读吗？

请给我最直白、最直接、最不绕弯、最干脆、最不墨迹、最戳痛点、最不废话、最不拐弯、最不啰嗦、最不掩饰、最实在、最通透、最有效、最利落、最硬核、最不玩套路的回答。”

“好的”

怎样让你的Agent更贴心？斯坦福提出全新的交互范式与评估基准，强调Agent应该主动“帮助用户构建偏好”，而非被动地“获取偏好”；全新范式RLMF（带元认知反馈的强化学习），直击大模型在元认知能力上的系统性缺陷（减少幻觉）；具身智能版《楚门的世界》：在4.8万条生成的交互数据中，机器人学成了“老司机”。

![图片](./assets/img-c8099425.jpg)

1. 智能体交互范式的转变：从“询问”到“构建”

对于致力于落地的Agent而言，用户交互的有效性往往是商业化与实用化的一大瓶颈。一旦面对非专家用户，智能体普遍依赖的“用户具备完整领域知识”的假设就会瞬间失效，导致多轮对话沦为无效的澄清与拉扯。现有的交互范式要么假设用户全知，要么要求智能体仅通过被动提问来抽取信息，这不仅无法获取用户的真实有效需求，而且严重拉低了智能体推荐与决策的准确率。

斯坦福大学研究团队提出了一套全新的交互范式与评估基准，强调Agent应该主动“帮助用户构建偏好”，而非被动地“获取偏好”。

![图片](./assets/img-f7e163e9.png)

提出COPREF模型：基于信息经济学中的SEC（搜索-体验-信任）框架，将用户偏好定义为一种随着对话动态演化的状态。

强调主动认知引导：Agent被要求通过提供具体示例和通俗解释（例如向用户解释登山靴的“齿深”如何影响防滑），主动帮助用户建立对关键特征的认知，扩展其知识边界。

构建COSHOP基准：为了量化评估Agent与非专家用户的协作能力，团队开发了涵盖时尚、电影和图书领域的交互式基准测试。

![图片](./assets/img-235c3924.png)

实验与结果：

研究在COSHOP基准上对5款前沿大语言模型进行了测试，结果揭示了当前LLM在处理复杂交互时的显著短板：没有任何一个模型的准确率超过56%。

数据对比非常直观，以Claude-Sonnet-4.6为例：当用户偏好完全明确时，其推荐准确率高达94.3%；但在需要经过五轮引导对话的COSHOP测试中，准确率断崖式下跌至27.6%。

![图片](./assets/img-ca37b6d7.png)

本篇研究深入剖析了高阶大模型的失败原因：Agent往往未能通过有效对话打破用户的知识盲区，或者生成的报告质量欠佳、遗漏关键特征描述，最终导致用户无法识别出正确的推荐。

标题：Beyond expert users: agents should help users construct preferences, not just elicit them

作者：Irena Saracay,Ludwig Schmidt,Carlos Guestrin

作者单位：Stanford University

摘要：COSHOP 基准测试与 COPREF 用户偏好构建模型针对智能Agent系统普遍假设用户具备完整领域知识的不现实前提，提出了一套新的交互范式。该系统解决的核心问题是：非专家用户往往缺乏形成完整偏好的领域知识，导致Agent仅通过澄清问题无法获取有效需求。核心方案包括引入 COPREF 模型，基于信息经济学中的搜索 - 体验 - 信任（SEC）框架，将用户偏好定义为随对话动态演化的状态，要求Agent主动通过示例和解释帮助用户构建对关键特征（如登山靴的齿深）的认知，而非被动询问。在此基础上构建了 COSHOP 交互式基准，涵盖时尚、电影和图书推荐领域，评估Agent与 COPREF 用户协作的准确率。实验结果显示，在评估的五个前沿大语言模型中，没有任何模型在 COSHOP 基准上超过 56% 的准确率。例如，claude-sonnet-4.6 在偏好完全明确时准确率为 94.3%，但在经过五轮对话的 COSHOP 测试中，团队准确率降至 27.6%。失败主要源于Agent未能通过对话扩展用户的知识边界，导致用户无法识别正确推荐，或Agent生成的报告质量差，遗漏关键特征描述。

论文链接：https://arxiv.org/pdf/2606.30863

2. 基于元认知反馈的强化学习 (RLMF)：打破大模型“高置信度幻觉”现状

现有的大模型在生成内容时，往往无法准确评估自身的内部不确定性，导致常常以极高的置信度输出错误信息（即幻觉）。这种元认知能力的缺失，严重限制了 LLM 在高要求、高容错率场景下的可信度与可靠性。

本文由耶鲁大学与谷歌研究团队联合推出，直击大模型在元认知能力上的系统性缺陷。创新性地提出带元认知反馈的强化学习范式（RLMF: Reinforcement Learning with Metacognitive Feedback），该研究成功赋予了模型精准的“知识边界认知”。实验证明，RLMF 在保持基础任务准确率的前提下，实现了跨任务的最先进忠实校准效果，相比标准强化学习性能提升高达 63%。

![图片](./assets/img-6805b8a0.png)

研究团队深入模型对齐的底层机制，提出了两大核心模块与一项关键策略：

带元认知反馈的强化学习（RLMF 范式）

在传统的偏好优化（如 RLHF）过程中，引入了“元认知优势缩放机制”。系统会依据模型对自身表现判断的质量，来动态调整完成结果的排序。简而言之，模型自评估越准确，其强化学习中的优势信号就越强，从而正向激励模型“实事求是”。

![图片](./assets/img-8e26daf6.png)

元认知数据选择（Metacognitive Data Selection）

放弃了传统的主动学习数据筛选方式，转而直接利用模型给出的自我评估分数来精准过滤和筛选高价值的训练样本，大幅提升了训练效率与数据质量。

两阶段解耦策略：从数值到自然语言的转化

针对忠实校准任务，方案首先校准模型自报告置信分数（数值）的忠实度；随后，将这些干瘪的数值巧妙地映射为自然、流畅且适应上下文的语言表达（如：“我不太确定，但可能是……”），使不确定性的表达更符合人类交互习惯。

实验结论：

性能大幅跃升：相比于标准强化学习基线，RLMF 方法的整体性能提升了 63%，且完美保持了原有的任务准确性。

压倒性的人工评估优势：在针对表达的多样性、自然度、有用性以及语境适应性的多维度盲测中，该方法对当前最强基线模型的平均胜率高达 96%。

强大的泛化能力：该机制不仅在特定任务上表现优异，更实现了跨任务泛化的忠实校准，证明了其底层逻辑的普适性。

标题：Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

作者：Gabrielle Kaili-May Liu,Avi Caciularu,Gal Yona,Idan Szpektor,Arman Cohan

作者单位：Yale University;Google Research

摘要：RLMF（带元认知反馈的强化学习）旨在解决大语言模型在元认知能力上的系统性缺陷，包括高置信度幻觉、无法识别知识边界以及错误表达内部不确定性等问题，从而提升模型的可信度与可靠性。该方法提出两个核心机制：一是RLMF范式，在偏好优化过程中，依据模型对自身表现判断的质量来调整完成结果的排序，通过引入元认知优势缩放机制，利用自评估准确性来缩放强化学习中的优势信号；二是元认知数据选择，利用模型的自我评估分数筛选高价值训练样本，优于传统的主动学习。针对忠实校准任务，该方案采用两阶段解耦策略：首先利用上述方法校准模型自报告置信分数的忠实度，随后将这些数值映射为自然、可适应上下文的语言不确定性表达。实验表明，RLMF在保持任务准确性的同时，实现了跨任务泛化的最先进忠实校准效果。相比标准强化学习，RLMF性能提升高达63%，显著增强了模型评估和表达自身能力局限的能力。系统性人工评估显示，在多样性、自然度、有用性及语境适应性方面，该方法对最强基线的平均胜率达到96%。

论文链接：https://arxiv.org/pdf/2606.32032

3. 具身智能与3D视觉技术深度结合的典范，VLK：从重建场景中的“合成交互”中学习人形机器人的运动与操作能力

当前人形机器人和具身智能领域面临一个核心瓶颈：在复杂的室内移动与操作（Loco-Manipulation）任务中，极度缺乏大规模、高质量且同步的“视觉-语言-运动学（Vision-Language-Kinematics）”真实交互数据。由于获取真机数据成本高、难度大，导致机器人难以高效学习到从感知到动作的全身协调控制策略。

![图片](./assets/img-13085dba.png)

针对数据匮乏的痛点，Amazon与UC Berkeley等联手，提出一种全新的交互范式，通过在重建场景中进行“合成交互”来自动化生成海量数据。

![图片](./assets/img-7a5af5ec.png)

核心创新：

尺度级3DGS场景重建：系统利用三维高斯泼溅（3D Gaussian Splatting）技术，重建出具有真实度量尺度的室内三维环境，作为机器人的虚拟训练场。

特权信息指引与事后渲染：在重建的虚拟场景中，首先利用环境的特权场景信息自动合成流畅的导航和物体交互轨迹，随后再逆向（事后）渲染出与之完美配对的、以机器人第一视角（自我中心）为基准的视觉观测数据。

零人工干预海量生成：该方法完全无需人工介入，全自动生成了多达48,000条“视觉-语言-运动”配对的高质量交互轨迹。

![图片](./assets/img-74491575.png)

实验与控制系统：

研究团队基于这4.8万条合成轨迹训练出了一套VLK策略（VLK Policy）：

- 运动轨迹预测：该策略能直接根据机器人当前捕捉到的第一视角图像、人类给出的任务指令以及机器人当前状态，实时预测短视域内的全身运动学轨迹。

- 物理动作转化：在实际部署时，系统引入全身跟踪器（Whole-Body Tracker），将上述预测的运动学轨迹无缝转化为物理人形机器人的实际关节动作。

真机部署：

研究团队在真实的宇树（Unitree）G1人形机器人上进行了严苛的导航与单物体运输实验：

- 成功的Sim-to-Real迁移：实验结果表明，该方法成功实现了从“虚拟合成数据”到“物理实体机器人”的感知基础操作迁移。

- 完整的感知-动作全闭环：Unitree G1机器人成功实现了从视觉定位、自主移动、精准抓取、稳定搬运到最终放置的完整闭环控制。

![图片](./assets/img-eab9070a.png)

这篇文章证明了利用3DGS重建真实世界，并结合自动化轨迹合成，能够实现48,000条无干预数据的超高效生成，并最终在真机上完成高难度的零样本部署。这为解决具身智能“数据荒”问题开辟了一条极具前景的新路径

标题：VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

作者：Yen-Jen Wang,Jiaman Li,Sirui Chen,Takara E. Truong,Pei Xu,Pieter Abbeel,Rocky Duan,Koushil Sreenath,Angjoo Kanazawa,Carmelo Sferrazza,Guanya Shi,Karen Liu

作者单位：Amazon FAR;UC Berkeley;Stanford University;Carnegie Mellon University

摘要：VLK 系统通过在被重建场景中的合成交互解决人形机器人位姿操作缺乏大规模同步视觉-语言-运动学数据的问题。该系统利用三维高斯泼溅技术重建具有度量尺度的室内环境，利用特权场景信息合成导航和物体交互轨迹，并在事后渲染配对的以自我为中心的视觉观测数据。系统无需人工干预即可生成 48000 条配对轨迹，训练出一个能够根据以自我为中心的图像、任务指令和当前机器人状态预测短视域全身运动学轨迹的 VLK 策略。部署时，全身跟踪器将这些预测转换为物理人形机器人的动作。在物理 Unitree G1 机器人上进行的导航和单物体运输实验表明，该方法能有效实现从仿真到现实的感知基础人形位姿操作迁移，成功完成了从视觉定位、移动、抓取、搬运到放置的完整感知到动作闭环。

论文链接：https://arxiv.org/pdf/2606.30645

4. 基于自进化Agent工作流的HLS代码自动重构系统AgRefactor

在芯片设计与硬件加速领域，将现实世界中的软件代码重构为可综合的高层综合（HLS）代码是一项关键但极具挑战的工作。当前的方法普遍面临通用性差、扩展性低以及计算成本高昂等痛点，传统的自动化工具或单一的大模型方法在面对复杂且冗长的工业级代码时，往往难以胜任。

UCLA与CMU联合提出了AgRefactor，这是一个基于大语言模型（LLM）的多智能体（Agentic）工作流，专门为解决复杂代码重构而设计。

核心创新点：

- 自进化记忆机制：系统引入了跨任务的记忆机制，能够自动积累和检索事实性与策略性知识。这种动态的知识检索与沉淀机制，显著提升了Agent在面对未见过的复杂程序时的鲁棒性和处理效率。

- 混合重构流水线：为了降低大模型调用的计算开销并增强扩展性，AgRefactor集成了自动重构工具HeteroRefactor。智能体可以在“LLM驱动的代码重写”与“高效的传统工具化转换”之间进行灵活调度，仅在必要环节调用大模型，实现了AI与传统工具的优势互补。

实验与结果分析：

研究团队在11个极具挑战性的现实世界基准测试中对AgRefactor进行了评估，这些基准测试的代码长度是以往同类研究中最复杂案例的5到10倍。

成功率表现优异：在11个测试案例中，AgRefactor有9个案例的性能优于或持平于当前最先进的自动重构工具及强基线LLM方法。

性能加速显著：经过智能体进一步的性能优化后，该系统实现了6.51倍的几何平均加速比，全面超越了最先进的pragma调优工具。此外，相比于高度优化的开源设计，它依然实现了1.20倍的加速，并且将额外资源消耗严格控制在20%以下。

标题：AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance

作者：Yang Zou,Zijian Ding,Yizhou Sun,Jason Cong

作者单位：Carnegie Mellon University;University of California, Los Angeles

摘要：AgRefactor是一个基于大语言模型的多智能体工作流，旨在解决将现实世界软件重构为可综合的高层综合（HLS）代码时面临的通用性差、扩展性低和计算成本高的问题。该系统核心引入了自进化记忆机制，能够跨任务自动积累和检索事实性与策略性知识，从而显著提升对未见程序的鲁棒性和效率。为降低开销并增强扩展性，AgRefactor集成了自动重构工具HeteroRefactor，使智能体能够灵活平衡大语言模型驱动的代码重写与高效的工具化转换，仅在必要时调用大模型。在11个具有挑战性的现实世界基准测试中，AgRefactor在9个案例上优于或持平于最先进的自动重构工具及强基线大语言模型方法，这些基准代码长度是以往研究中最复杂案例的5到10倍。进一步的智能体性能优化实现了6.51倍的几何平均加速比，超越了最先进的pragma调优工具，同时相比高度优化的开源设计实现了1.20倍的加速，且额外资源消耗低于20%。

论文链接：https://arxiv.org/pdf/2606.30949

5. CoMet：针对多模态大语言模型开放空间不确定性评估的全新分解框架

在开放式（open-ended）场景下，多模态大语言模型面临着不确定性来源多样且答案空间无界的双重挑战，这导致传统的评估方法难以准确量化模型的可靠性。现有的不确定性估计方法往往在此类复杂且自由度极高的设置中失效。

为解决上述难题，普林斯顿大学提出了一种名为CoMet的新颖不确定性分解方法，实现高效且准确的评估。

![图片](./assets/img-76b555cb.png)

核心创新点

预测不确定性分解：首创性地将不确定性拆解为两部分：“上下文特定项”（用于量化由任务或提示定义的合理答案空间的广度）和“多重性特定项”（用于衡量在给定输入下，与上下文相兼容的合理答案的数量）。

高效的评估机制：系统训练了一个轻量级的后处理不确定性模块，利用多模态大语言模型本身作为验证器策略来获取匹配概率，并通过简单的数据集构建过程来近似上下文条件下的答案分布。

零采样开销：该方法引入了匹配变量和Renyi熵来量化开放空间不确定性，最大的优势在于它完全无需进行耗时的自回归答案生成或重复采样，即可高效估计不确定性。

实验与结果分析

研究团队在多种开放式多模态基准测试、幻觉检测任务以及多项选择视觉问答（VQA）基准上对CoMet进行了全面评估。

实验结果一致表明，CoMet在保持实际应用高效率的同时，表现始终优于现有的各项基线方法，极其显著地提升了不确定性估计的准确率。

标题：CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation

作者：Sanghyuk Chun,William Yang,Amaya Dharmasiri,Olga Russakovsky

作者单位：Princeton University

摘要：CoMet 通过一种新颖的不确定性分解方法，解决了多模态大语言模型在开放-ended 设置中因不确定性来源多样和答案空间无界而导致的评估难题。该方法将预测不确定性分解为上下文特定项和多重性特定项：前者量化由任务或提示定义的合理答案空间的广度，后者衡量在给定输入下与上下文兼容的合理答案数量。CoMet 训练了一个轻量级的后处理不确定性模块，利用多模态大语言模型作为验证器策略获取匹配概率，并通过简单的数据集构建过程近似上下文条件答案分布。该方法无需自回归答案生成或重复采样即可高效估计不确定性。在多种开放-ended 多模态基准测试、幻觉检测以及多项选择视觉问答基准上的实验表明，CoMet 在保持实际高效性的同时， consistently 优于现有基线方法，显著提升了不确定性估计的准确性。

论文链接：https://arxiv.org/pdf/2606.32012

阅读推荐：

- [推理效率暴涨 11 倍！SPIRAL 框架让大模型终于学会“自己搜索、自己复盘”？ | arXiv每周论文推荐](https://mp.weixin.qq.com/s?__biz=Mzg2MzgwNzE4Mw==&mid=2247530144&idx=1&sn=2afdc7c19d32a11e165ef92dbb526218&scene=21#wechat_redirect)

- [Agent刚上岗当代码审查员，就被“职场潜规则”骗惨了 | arXiv每周论文推荐](https://mp.weixin.qq.com/s?__biz=Mzg2MzgwNzE4Mw==&mid=2247529764&idx=1&sn=79b7a8a2df8d266a39d89d507537c6c2&scene=21#wechat_redirect)

- [内存狂省2.7倍，推理加速3.3倍——自动驾驶大模型的“Token爆炸”被它治好了 | arXiv每周论文推荐](https://mp.weixin.qq.com/s?__biz=Mzg2MzgwNzE4Mw==&mid=2247529093&idx=1&sn=aaaec67534ce97c7b68960a37d0ccf46&scene=21#wechat_redirect)

* 点击“阅读原文”，了解黄大年茶思屋科技网站论文分享专题页更多精彩内容。

扫码进入茶思屋科技网站

加入茶思屋产学研思想碰撞

转载请联系本公众号获得授权

投稿：hdncsw@huawei.com
