🤝 智能体

257 条新闻

🟢 🤝 智能体 2026年7月11日 · 1 分钟阅读

arXiv:2607.08093:CausalDS — 衡量 AI 智能体在数据科学任务中因果推理能力的新基准

创意插图:智能体将标有「原因」和「相关性」的两条交织曲线分离开来

CausalDS 是 arXiv 上提出的基准,用于测试 AI 智能体能否在数据科学工作流中区分因果性与相关性。它填补了自主分析智能体评估中的空白——现有标准测试只衡量执行步骤的准确性,而非正确因果推理的能力。

🟢 🤝 智能体 2026年7月11日 · 1 分钟阅读

arXiv:2607.08681:SolarChain-Eval — 用于去中心化能源市场 AI 智能体的物理约束基准

创意插图:太阳能板通过网络连接,AI 智能体在其中进行能源交易

SolarChain-Eval 是 arXiv 上提出的基准,用于评估去中心化能源市场中经济型 AI 智能体的行为,并纳入真实系统的物理约束。该基准包含一个基于语言模型的审计层,用于检测智能体的风险行为,将 AI 智能体与网络物理能源基础设施相结合。

🟡 🤝 智能体 2026年7月10日 · 1 分钟阅读

LangChain: OpenWiki Brains为代理带来主动记忆——自动从Gmail、Notion和Git收集上下文并保存为Markdown

创意插图:机器人从电子邮件、笔记和仓库中拼组Markdown页面组成的wiki

OpenWiki Brains是LangChain的开源框架,为AI代理提供主动记忆:自动从外部来源收集上下文并以Markdown文件形式保存在磁盘上。第一个版本支持6个连接器——Gmail、Notion、Git、Twitter/X、Hacker News和网络搜索——通过定时任务在本地运行,而非依赖云端。

🟢 🤝 智能体 2026年7月10日 · 1 分钟阅读

arXiv:2607.08403:博弈论对抗幻觉——多智能体框架将模型建模为战略博弈者以减少虚构内容

创意插图:数位AI博弈者围坐棋盘,协调各自的走法以趋近真相

该论文提出了一种利用博弈论减少大型语言模型幻觉的多智能体框架。模型之间的交互被建模为战略博弈者之间的博弈,其中均衡状态对应于一致且无幻觉的回答,提供了一条有别于标准RLHF和RAG方法的新路径。

🟡 🤝 智能体 2026年7月9日 · 1 分钟阅读

arXiv:2607.06906:「Harness Effect」——编排设计将 AI 智能体成本削减 41%,效果超过更换模型

编辑插图:指挥棒引导 token 流在模型和工具之间流动

Harness Effect 是 32 位作者的实证研究发现:编排层设计对 AI 智能体成本的影响超过模型本身的选择。在 22 项任务和 6 个模型上,优化的编排将每任务成本降低 41%(从 0.21 降至 0.12 美元),token 消耗减少 38%,执行时间缩短 44%——同时质量提升。

🟡 🤝 智能体 2026年7月9日 · 1 分钟阅读

IBM: Bob 成为多智能体平台——COBOL 现代化九个月的项目在 3 天内完成

编辑插图:大型机机柜中小智能体群将代码迁移至现代服务器

IBM Bob 是面向软件开发的智能体平台,新版本引入覆盖整个开发周期的多智能体架构、Bobalytics 分析以及用于 COBOL 和 PL/I 大型机现代化的 Premium 套餐。IBM 报告称,客户 Blue Pearl 在 Bob 的协助下将一个九个月的现代化项目在三天内完成。

🟡 🤝 智能体 2026年7月9日 · 1 分钟阅读

OpenAI: ChatGPT 成为真正的工作智能体——可跨应用操作,自主工作数小时直至完成

编辑插图:多屏工作台,自动化任务流在屏幕间流转

ChatGPT Work 是 OpenAI 向智能体工作的重要跨越:ChatGPT 现在可以跨应用和文件执行操作,自主处理项目数小时,将目标变为完成的成果。OpenAI 将其定位为最雄心勃勃任务的伙伴,直接挑战 Anthropic 和 GitHub 的智能体产品。

🟡 🤝 智能体 2026年7月8日 · 3 分钟阅读

探针级联从第一步隐藏激活预测AI智能体失败,节省高达47%的token

编辑配图:从神经网络隐藏状态预测并提前中止注定失败的智能体轨迹

研究人员在LLM智能体隐藏激活上开发了轻量级探针系统,能在第一步交互时就检测注定失败的轨迹,在Qwen-2.5-7B上节省47.1%的token消耗,在Llama-3.2-3B上节省37.2%,并保证90%的召回率。

🟡 🤝 智能体 2026年7月8日 · 3 分钟阅读

形式理论精确界定:LLM迭代反思何时带来指数级性能提升?

编辑配图:上下文内自分析与搜索何时改善AI系统推理能力的理论

研究人员Wolf、Wies和Shashua建立了贝叶斯理论框架,证明语言模型的自我改进仅在反思能可靠定位错误时才提供指数级收益——否则,顺序尝试在渐近意义上不优于并行采样。

🟡 🤝 智能体 2026年7月8日 · 3 分钟阅读

LangChain与NVIDIA发布NemoClaw:开放智能体栈成本比竞争对手低10倍

编辑配图:LangChain与NVIDIA NemoClaw开放智能体栈,基于Nemotron 3 Ultra架构

LangChain与NVIDIA联合发布NemoClaw——这一开放蓝图结合了Nemotron 3 Ultra模型、LangChain Deep Agents Code框架和OpenShell运行时。该组合达到0.86的综合评分,每次评估成本仅4.48美元,而次优竞争对手的成本为43.48美元——同时完全自托管、数据不离本地。

🟡 🤝 智能体 2026年7月7日 · 3 分钟阅读

LLM-as-a-Verifier:验证作为语言模型扩展的全新第四维度

编辑插图:LLM作为验证器,验证作为AI模型扩展的全新维度

斯坦福大学和UC伯克利的研究人员将验证——评估解决方案正确性的能力——识别为LLM扩展的全新维度,与现有范式正交。该框架生成连续验证分数,并在四个基准上达到SOTA:Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和MedAgentBench(73.3%)。

🟡 🤝 智能体 2026年7月7日 · 3 分钟阅读

Google为Gemini API中的Managed Agents扩展生产级功能

编辑插图:Google Gemini API为开发者扩展托管智能体功能

Google在Gemini API中新增了后台执行、Remote MCP集成、自定义函数调用和凭证刷新四项功能,使开发者能够在原型环境之外部署智能体。

🟡 🤝 智能体 2026年7月7日 · 3 分钟阅读

LangChain:改进智能体是一个数据挖掘问题

编辑插图:LangChain智能体与从执行轨迹中挖掘数据以提升可观测性

LangChain的Vivek Trivedy认为,系统性改进AI智能体本质上是大规模挖掘执行轨迹的问题。推荐顺序:工程框架(harness)优先,其次微调,再次框架优化。核心建议:尽早部署智能体,以启动数据收集循环。

🟢 🤝 智能体 2026年7月7日 · 3 分钟阅读

Claude Code v2.1.203 — 会话过期警告、更小的二进制文件、更快的启动速度

编辑插图:Claude Code v2.1.203修复登录过期问题并支持会话恢复

Anthropic于7月7日发布Claude Code v2.1.203,新增登录令牌过期警告,支持自动恢复冻结的后台会话,并将二进制文件大小减少约7 MB。同时修复了多个导致macOS卡顿并影响子智能体运行的错误。

🟢 🤝 智能体 2026年7月7日 · 3 分钟阅读

AgentGym2:全新基准在去理想化条件下测试LLM智能体

编辑插图:AgentGym2基准用于测试AI网络智能体在去理想化现实场景中的表现

研究人员发布了AgentGym2——一个在信息不完整和工具未知的真实条件下测试15个LLM智能体的评估框架。包括GPT-5和Gemini在内的所有模型均表现显著欠佳,揭示了当前技术水平与生产级部署需求之间的巨大差距。该论文已被ACL 2026接收。

🟡 🤝 智能体 2026年7月3日 · 3 分钟阅读

Claude Code v2.1.200:默认权限模式更改为手动

编辑插图:带有新安全修复和手动权限的Claude Code CLI代理

Anthropic于2026年7月3日发布Claude Code v2.1.200。所有界面的默认权限模式已更改为手动(Manual),AskUserQuestion对话框在未进行显式配置的情况下不再自动继续。修复了守护进程被接管的安全漏洞,改善了后台会话和子代理速率限制处理问题,并消除了tmux 3.4+下的渲染闪烁问题。

🟡 🤝 智能体 2026年7月2日 · 2 分钟阅读

ICML 2026研究:SFT与RL智能体在受控基准之外性能大幅下降

编辑插图:AI智能体在工具使用中的分布偏移脆弱性与泛化鲁棒性

该论文被ICML 2026接收,通过感知、交互、推理和内化四个层次系统测试了工具使用LLM智能体在环境偏移下的表现。研究发现:SFT和RL训练在面对小幅分布偏移时均表现出显著的性能退化,受控基准上的准确率无法预测真实的鲁棒性。论文提出PAFT(扰动增强微调)作为缓解方案。

🟡 🤝 智能体 2026年7月2日 · 2 分钟阅读

SEA:具备实时形式化安全保证的自我修改智能体

编辑插图:具备形式化安全证书和行为验证的自我进化AI智能体

SEA(Self-Evolving Agents with Anytime-Valid Certificates)架构允许智能体在保留形式化学习理论保证的同时更新自身参数。五种验证机制和可审计证书实时批准或阻止每次自我修改,在SWE-bench Verified测试中,强基础模型上额外解决了4至5个实例。

🟡 🤝 智能体 2026年7月2日 · 3 分钟阅读

GitHub Copilot智能体获得公开预览版会话流传输功能

编辑插图:GitHub Copilot智能体会话实时流传输公开预览

GitHub于2026年7月2日启动了Copilot智能体会话流传输功能的公开预览,企业组织由此可实时查看智能体在所有Copilot客户端中执行的提示词、响应及工具调用。

🟢 🤝 智能体 2026年7月2日 · 2 分钟阅读

AutoMem:将记忆管理作为可学习技能而非架构选择

编辑插图:记忆作为可学习认知技能——智能体学习与记忆的图引擎

斯坦福大学研究人员开发了AutoMem——一个具有两个优化循环的系统,能够自动学习如何组织和使用记忆,无需人工标注,在基线方法上取得了2至4倍的性能提升。

🟡 🤝 智能体 2026年7月1日 · 2 分钟阅读

Claude Code v2.1.198:后台智能体现可自动创建拉取请求,新增 /dataviz 技能

编辑插图:Claude Code 智能体视图自动化拉取请求与后台智能体

Anthropic 发布了 Claude Code v2.1.198,带来多项重要更新:在 worktree 中运行的后台智能体现可自动提交、推送并创建草稿拉取请求而无需暂停等待;Claude in Chrome 已正式发布(GA);新增用于图表设计的 /dataviz 技能;并将 AWS 添加为上游网关提供商。

🟡 🤝 智能体 2026年7月1日 · 3 分钟阅读

AWS 发布无服务器 A2A 网关,用中央注册表替换 190 条点对点连接

编辑插图:AWS 无服务器网关用于智能体间通信和路由发现

Amazon Web Services 发布了无服务器 A2A 网关的参考架构,集中管理 AI 智能体之间的服务发现、路由和访问控制。二十个智能体在没有协调的情况下会产生多达 190 条互连——网关将其简化为单一入口点。

🟡 🤝 智能体 2026年7月1日 · 3 分钟阅读

AWS AgentCore Memory 引入元数据过滤——准确率从 40% 跃升至 64%

编辑插图:AWS AgentCore 内存命名空间与 AI 智能体的元数据过滤

Amazon Bedrock AgentCore Memory 引入了属性元数据过滤,该过滤在语义搜索之前应用。在 151 个问题的基准测试中,总体准确率从 40% 提升至 64%,上下文相关查询的准确率从 16% 提升至 69%。

🟡 🤝 智能体 2026年7月1日 · 2 分钟阅读

LangChain 推出 RLM 智能体:递归模型在长上下文中实现 79% 的性能提升

编辑插图:LangChain 深度智能体与 QuickJS 编排器处理长上下文

LangChain 通过 DeepAgents 框架引入了递归语言模型(RLM)——这是一种模型在输入片段上递归调用自身的方法,而非将整个上下文塞入单个窗口。在 128k token 的 OOLONG 基准测试任务中,RLM 智能体得分为 0.79,而标准智能体为 0.44,提升幅度达 79%。

🟡 🤝 智能体 2026年6月30日 · 2 分钟阅读

Claude Sonnet 5 登陆 GitHub Copilot,智能体模式扩展至 JetBrains:开发团队的双重礼包

编辑配图:GitHub Copilot 为 JetBrains IDE 引入 Claude Sonnet 5 和智能体模式

就在 Anthropic 发布 Claude Sonnet 5 的同一天,GitHub Copilot 宣布该模型在所有平台正式公开可用(GA),同时 Copilot 智能体模式从 VS Code 扩展至 JetBrains 开发环境——IntelliJ、PyCharm、GoLand 和 WebStorm。

🟡 🤝 智能体 2026年6月30日 · 2 分钟阅读

SkillOpt:微软研究院将智能体指令文件视为可训练参数

编辑配图:微软 SkillOpt 将智能体技能视为可优化的可训练参数

微软研究院发布 SkillOpt——一个通过迭代正向-反向循环优化智能体技能文件、无需微调模型权重的系统。在 52 个评估单元上达到最优或持平结果,GPT-5.5 在经过技能优化后,六项基准测试的平均准确率从 58.8% 提升至 82.3%。

🟢 🤝 智能体 2026年6月30日 · 3 分钟阅读

TRIAGE:如何在智能体强化学习中将功劳归因给正确的 token

编辑配图:TRIAGE 方法在智能体强化学习中按角色分配功劳

研究人员提出 TRIAGE——一个将轨迹片段分类为四种语义角色并为每种角色分配不同奖励信号的框架,而非像 GRPO 一样均等对待所有 token。在 ALFWorld、Search-QA 和 WebShop 基准测试上,TRIAGE 将与环境的交互动作数量减少了 10.4% 至 14.8%。

🔴 🤝 智能体 2026年6月29日 · 2 分钟阅读

Microsoft Research:Memora——减少最多98%Token消耗并在长对话上达到SOTA的AI智能体记忆框架

编辑插图:Memora——减少最多98%Token消耗并在长对话上达到SOTA的AI智能体记忆框架,无文字无人脸

Memora是Microsoft Research为长周期AI智能体设计的可扩展记忆框架。它引入谐波架构,将「存储什么」与「如何检索」分离,配合线索锚点和策略驱动检索器。在LoCoMo和LongMemEval基准上达到SOTA,与全上下文方法相比Token消耗最多减少98%。

🟡 🤝 智能体 2026年6月29日 · 2 分钟阅读

arXiv:2606.27483:内化未来——LLM智能体世界模型规划的统一训练范式

编辑插图:2606.27483:内化未来——LLM智能体世界模型规划的统一训练范式,无文字无人脸

「内化未来」是腾讯研究人员张璇等九位作者于2026年6月25日提交至arXiv的预印本。该论文提出三阶段训练(WM-AMT、FE-SFT、FC-RL),使LLM智能体发展出世界模型——生成未来状态预测并评估计划成功率的能力,而非单纯的被动反应。

🟡 🤝 智能体 2026年6月29日 · 2 分钟阅读

LangChain:Deep Agents中的Dynamic Subagents——智能体编写代码并行调度数百个子智能体

编辑插图:Deep Agents中的Dynamic Subagents——智能体编写代码并行调度数百个子智能体,无文字无人脸

Dynamic Subagents是LangChain Deep Agents框架中的编排架构,允许模型编写JavaScript脚本并行调度数百个子智能体。QuickJS解释器确定性地执行脚本,从而消除300+次顺序工具调用。系统定义了六种编排模式——从classify-and-act到loop-until-done。

🟢 🤝 智能体 2026年6月29日 · 1 分钟阅读

Microsoft:2026智能体信心指数——300位构建者对AI智能体的平均信心得分64/100

编辑插图:2026智能体信心指数——300位构建者对AI智能体的平均信心得分64/100,无文字无人脸

2026智能体信心指数是Microsoft与MIT Technology Review Insights合作开展的调研,对来自12个行业的300位技术专家就101项任务的AI智能体信心进行评估。平均得分64/100;仅30项任务超过70分;59%的专家将「人工监督循环」列为首要顾虑。

🟢 🤝 智能体 2026年6月28日 · 1 分钟阅读

arXiv:2606.26806: EVAF 将智能体记忆固化入模型参数,在上下文清除后保持目标持久性

编辑插图:痕迹刻入网状结构并在清除后仍然留存,无文字无人脸

arXiv:2606.26806 研究(Haoliang Han)提出 EVAF,一种门控 LoRA 固化机制,可在长期运行语言智能体的工作上下文被清除后仍保持目标持续性。EVAF 每 200 个事件仅需 2–3 次参数写入,在目标持久性测试中表现优异(0.812–0.904),而检索在事实回忆上占优(0.956–0.973)。

🟡 🤝 智能体 2026年6月27日 · 2 分钟阅读

arXiv:2606.26758: EGG——多代理框架生成GPU内核比PyTorch快2.13倍

编辑插图:多代理系统优化GPU数据流和矩阵块图,无人脸

EGG是一个自动生成LLM推理优化GPU内核的多代理框架。通过两阶段方法——算法结构设计加硬件调优——实现了相对PyTorch基准平均2.13倍的加速,在KernelBench上超越了代理方法和基于强化学习的方法。

🟡 🤝 智能体 2026年6月27日 · 1 分钟阅读

AWS:Stripe部署100+个AI代理用于金融合规——来自生产环境的经验教训

编辑插图:AI代理网络在云基础设施中监控金融交易

Stripe和AWS介绍了这家年处理1.4万亿美元交易的平台如何在不到一年内部署了100多个AI合规代理。基于ReAct框架和Amazon Bedrock的代理带来了26%更快的审查速度、95%的欺诈检测率和60%更低的成本。

🟢 🤝 智能体 2026年6月27日 · 1 分钟阅读

arXiv:2606.26649: AI代理指令转换为形式化验证的策略即代码

编辑插图:机械臂将文本文档转换为安全策略盾牌上的验证代码块

研究人员开发了一种流水线,利用Cedar策略语言和LLM生成器-批评者循环,将AI代理的自然语言指令、MCP工具描述和策略文档自动转换为形式化验证代码,实现的规范覆盖率远高于手动编写的符号化执行。

🟢 🤝 智能体 2026年6月27日 · 1 分钟阅读

Anthropic:Claude Code v2.1.195——禁用鼠标、改进语音听写和钩子修复

编辑插图:深色背景上带有Claude Code标志、钩子图标和语音波形的终端界面

Claude Code v2.1.195是一个小型生活质量更新,带来了在全屏模式下禁用鼠标点击的新环境变量、修复带连字符的钩子匹配器,以及改进macOS上CJK语言的语音听写功能。

🟢 🤝 智能体 2026年6月27日 · 1 分钟阅读

LangChain:Deep Agents框架中的提示缓存降低长期代理延迟

编辑插图:带有分层内存缓存示意图的机器人代理,电路背景,无文字或人脸

LangChain在Deep Agents框架中引入了提示缓存——一种在代理步骤之间复用已计算上下文的技术——旨在降低多轮代理的延迟和成本。

🔴 🤝 智能体 2026年6月26日 · 2 分钟阅读

arXiv:2606.25996: Autodata——Meta FAIR开发的智能体数据科学家,可自动生成高质量合成数据

编辑插图:机器人科学家在现代研究实验室中检查数据图表和合成数据集流水线

Autodata是Meta FAIR的系统,其中AI智能体扮演数据科学家角色,自主构建高质量合成数据集。Agentic Self-Instruct方法对智能体本身进行元优化,在CS研究、法律推理和数学推理领域相较静态基线持续提升效果。

🟡 🤝 智能体 2026年6月26日 · 2 分钟阅读

Anthropic:Claude Code v2.1.193——Shell命令自动模式分类器与OpenTelemetry日志记录

编辑插图:终端界面显示Shell分类器和遥测日志记录,无人脸

Claude Code v2.1.193是2026年6月25日发布的更新,引入了将所有Bash和PowerShell命令路由至自动模式的分类器,在界面中添加拒绝原因显示,并为企业可观测性提供新的OpenTelemetry模型响应日志事件。

🟡 🤝 智能体 2026年6月26日 · 1 分钟阅读

LangChain:LangSmith Fleet On-Call Copilot、Computer Use与Deep Agents RubricMiddleware

编辑插图:带有警报分诊智能体和隔离虚拟机环境图标的LangSmith仪表板

LangChain在六月通讯中发布了用于自动警报分诊的Fleet On-Call Copilot、为智能体提供隔离虚拟机的Computer Use,以及开源RubricMiddleware——后者使Box的智能体开发速度提升3倍,Harmonic用户留存率提升4倍。

🟡 🤝 智能体 2026年6月26日 · 1 分钟阅读

OpenAI:智能体如何改变工作——Codex每周500万用户,增长400%

编辑插图:机械臂与人手在现代办公室内协作处理发光的数字工作流程

OpenAI报告AI智能体在商业环境中呈爆炸式增长:Codex在2026年实现400%的增长并拥有500万周活用户,而替代30分钟以上人工工作的任务占比已达80.6%。

🔴 🤝 智能体 2026年6月25日 · 2 分钟阅读

Google:Gemini 3.5 Flash中的Computer Use — 浏览器、手机与桌面智能体

编辑插图:AI智能体在多个屏幕上操控浏览器和移动界面

谷歌将Computer Use工具集成到Gemini 3.5 Flash中,使AI智能体能够自主控制浏览器、移动设备和桌面应用程序。该模型取得迄今最佳OSWorld成绩,并配备企业级提示注入攻击防护。

🟡 🤝 智能体 2026年6月25日 · 2 分钟阅读

Anthropic:Claude Code v2.1.191 — /rewind命令、CPU减少37%、MCP重试逻辑

编辑插图:带有rewind和CPU优化图标的Claude Code终端界面

Claude Code v2.1.191于2026年6月24日发布,引入/rewind命令用于在/clear后恢复会话,将流式传输CPU消耗降低37%,并带来针对瞬时网络错误的MCP重试逻辑及已批准沙箱主机的记忆功能。

🟢 🤝 智能体 2026年6月25日 · 1 分钟阅读

LangChain:如何为AI智能体赋予记忆 — 通过LangSmith实现捕获、分析与更新

编辑插图:带有捕获、分析、更新标注的AI智能体三阶段记忆循环示意图

LangChain发布了为AI智能体添加记忆的实用指南,介绍三阶段循环:追踪记录、分析与记忆更新,并使用LangSmith Observability、Engine和Context Hub工具。

🔴 🤝 智能体 2026年6月24日 · 2 分钟阅读

Anthropic:Claude Tag将多人AI助手直接引入Slack团队

编辑插图:多名用户共享同一AI助手的Slack频道,显示团队界面中的消息和标注

Claude Tag是Anthropic的新产品,允许团队在Slack频道中@Claude——每个频道共享一个Agent,可异步工作数小时乃至数天,记住对话上下文并主动标记重要信息。Anthropic产品团队内部版本已生成65%的代码。

🟡 🤝 智能体 2026年6月24日 · 2 分钟阅读

Anthropic:Claude Code v2.1.187——沙盒凭证保护、组织模型限制、CJK修复

编辑插图:显示Claude Code界面的终端,带有锁图标和凭证保护标识

Claude Code v2.1.187于2026年6月23日发布,引入sandbox.credentials设置以阻止沙盒内读取机密变量,新增组织级模型选择限制,并修复MCP调用卡死和CJK乱码错误。

🟡 🤝 智能体 2026年6月24日 · 2 分钟阅读

GitHub:Copilot获得新CLI终端界面和自带API密钥支持(BYOK)

编辑插图:带选项卡的终端窗口显示AI助手界面,背景为GitHub Copilot徽标

GitHub Copilot CLI终端界面正式发布,新的BYOK(自带密钥)选项允许用户使用自己的OpenAI、Anthropic、Ollama等服务商API密钥——无需强制使用Copilot模型层。

🟡 🤝 智能体 2026年6月24日 · 2 分钟阅读

NVIDIA:Agent Toolkit——基于Nemotron模型的企业AI Agent开放基础平台

编辑插图:NVIDIA Agent Toolkit架构模块化示意图,展示与企业系统的连接,无人脸和文字

NVIDIA Agent Toolkit是构建企业AI Agent的开放平台,结合Nemotron开放模型、NemoClaw护栏和OpenShell安全运行时。CrowdStrike等合作伙伴已实现98.5%的安全告警分诊准确率,数月的研究工作被压缩至数天。

🟢 🤝 智能体 2026年6月24日 · 1 分钟阅读

arXiv:2606.22844:RaMem解决长期Agent记忆中的上下文坍塌问题

编辑插图:机器人Agent从按时间和会话上下文组织的发光记忆片段中检索信息

RaMem是一个四阶段框架,可防止Agent记忆系统中的上下文坍塌——即压缩片段失去周围上下文、被错误地视为同等相关的状态。在长期记忆基准测试中,相比现有基线系统平均F1分数提升超过10%。

🟢 🤝 智能体 2026年6月24日 · 1 分钟阅读

CNCF:Agent Auth——AI Agent的安全身份与权限委托

编辑插图:云原生架构中令牌在Agent与用户身份之间流转的示意图,象征性呈现权限委托

CNCF阐释了为何AI Agent需要自己的加密身份和权限委托机制。On-Behalf-Of令牌同时携带Agent身份和用户主体,并明确定义范围——这正是传统纯用户认证模型所缺少的。

查看完整档案 →