LangChain: OpenWiki Brains为代理带来主动记忆——自动从Gmail、Notion和Git收集上下文并保存为Markdown
OpenWiki Brains是LangChain的开源框架,为AI代理提供主动记忆:自动从外部来源收集上下文并以Markdown文件形式保存在磁盘上。第一个版本支持6个连接器——Gmail、Notion、Git、Twitter/X、Hacker News和网络搜索——通过定时任务在本地运行,而非依赖云端。
过去 72 小时,按类别整理
OpenWiki Brains是LangChain的开源框架,为AI代理提供主动记忆:自动从外部来源收集上下文并以Markdown文件形式保存在磁盘上。第一个版本支持6个连接器——Gmail、Notion、Git、Twitter/X、Hacker News和网络搜索——通过定时任务在本地运行,而非依赖云端。
该论文提出了一种利用博弈论减少大型语言模型幻觉的多智能体框架。模型之间的交互被建模为战略博弈者之间的博弈,其中均衡状态对应于一致且无幻觉的回答,提供了一条有别于标准RLHF和RAG方法的新路径。
Harness Effect 是 32 位作者的实证研究发现:编排层设计对 AI 智能体成本的影响超过模型本身的选择。在 22 项任务和 6 个模型上,优化的编排将每任务成本降低 41%(从 0.21 降至 0.12 美元),token 消耗减少 38%,执行时间缩短 44%——同时质量提升。
IBM Bob 是面向软件开发的智能体平台,新版本引入覆盖整个开发周期的多智能体架构、Bobalytics 分析以及用于 COBOL 和 PL/I 大型机现代化的 Premium 套餐。IBM 报告称,客户 Blue Pearl 在 Bob 的协助下将一个九个月的现代化项目在三天内完成。
ChatGPT Work 是 OpenAI 向智能体工作的重要跨越:ChatGPT 现在可以跨应用和文件执行操作,自主处理项目数小时,将目标变为完成的成果。OpenAI 将其定位为最雄心勃勃任务的伙伴,直接挑战 Anthropic 和 GitHub 的智能体产品。
《LLM中的超级权重》是一篇被COLM 2026接收的论文,识别出「超级权重」——少量参数,其改变对语言模型行为产生不成比例的影响。论文表明,正是这些权重解释了为何仅对部分层进行选择性微调往往会失败,对PEFT和LoRA方法具有直接影响。
SensorFM 是 Google 用于可穿戴设备健康数据的基础模型,基于来自 100 多个国家 500 万用户的 Fitbit 和 Pixel Watch 超过万亿分钟的信号训练而成。在 35 项任务中赢得 34 项,分类任务 AUC 提升 +9%,回归任务相关性提升 +21%。
Aurora 1.5 是微软的开源地球系统基础模型,在 88.9% 的评估变量和预报时效上超越 ECMWF 集合预报。新版本新增 22 个气象变量、小时级分辨率和概率集合预报,针对飓风 Helene 的路径误差比初代 Aurora 降低约 33%。
GPT-5.6 是 OpenAI 推出的全新模型家族,包含三款变体:Sol(旗舰推理)、Terra(均衡型)和 Luna(高容量、成本高效型)。新增程序化工具调用、显式提示缓存控制、持久化推理及多智能体编排测试版,首日即登陆 GitHub Copilot。
Muse Spark 1.1 是 Meta Superintelligence Labs 面向智能体任务的多模态推理模型,上下文窗口达百万 token。模型可协调子智能体、在多个应用中导航工作流,并接受图像、视频和 PDF 输入,现已通过 Meta Model API 公开预览,并在 Meta AI 应用的 Thinking 模式中可用。
Amazon SageMaker AI推出了NVIDIA Nemotron 3模型的无服务器定制化功能,无需管理基础设施。提供三种技术:SFT(监督微调)、RLVR(可验证奖励强化学习)和RLAIF(AI反馈强化学习),使企业团队无需机器学习基础设施知识即可使用先进的强化学习方法。
GitHub发现,将Copilot代码审查迁移到更好维护的工具后,结果起初变差了——原因不是工具,而是不适配新工具和实际工作流程的过时提示词。通过将提示词重写为diff优先方式(批量发现后再读文件,分析锚定在PR diff上),他们在保持同等质量的前提下将平均审查成本降低了约20%。
Deutsche Telekom与OpenAI签署了将运营商转型为AI原生电信公司的合作协议,应用领域涵盖客户支持、员工工具、网络运营和语音AI。Deutsche Telekom是欧洲最大运营商之一,全球约有2.45亿用户,使此次合作成为电信行业规模最大的AI交易之一。
Claude Code v2.1.206是Anthropic CLI工具的新版本,引入了带路径建议的/cd命令、建议精简CLAUDE.md文件的/doctor检查,以及在/commit-push-pr中自动批准推送到已配置远端的git push功能。后台代理现在在升级后立即更新,无需在下次连接时经历缓慢的升级过程。
Henry Schein One基于Amazon SageMaker开发了「Image Verify」AI系统,用于实时验证牙科X光影像质量。该系统已在10,000多个地点部署,每周处理超过1100万张X光影像,平均延迟1.4秒,旨在减少因影像质量差导致的保险理赔拒绝。
「过度思考」是一篇被ICML 2026接收的论文,表明增强大型语言模型的推理权重可以提取出模型通常不会暴露的隐藏学习信息。这一发现开辟了针对推理型模型(如o1、DeepSeek R1和开启长思考的Claude)的全新提取攻击类别。
CodeQL 2.26.0是GitHub静态安全分析工具的新版本,将AI提示注入攻击检测作为新分析类型引入,同时支持Kotlin 2.4.0。这是首次将AI特定攻击向量集成到主流SAST工具中,使提示注入与XSS和SQL注入进入相同的安全工作流程。
Bio Bug Bounty 是 OpenAI 的一项计划,外部研究人员将寻找 GPT-5.5 中的生物安全漏洞——即模型在安全措施下仍可能提供危险生物科学信息的途径。这是大型 AI 实验室首个专门针对生物安全的正式漏洞赏金计划,借鉴了网络安全领域的赏金实践。
DT-Guard通过在训练中使用推理监督、但在推理时只输出结构化安全标签,解决了安全护栏系统的根本困境——速度与鲁棒性的取舍。40亿参数模型实现双侧F1=0.878,超越80亿参数基准模型。
Ben Bernanke 是 2006 至 2014 年间担任美联储主席、并于 2022 年获得诺贝尔经济学奖的经济学家,Anthropic 已将其任命为 Long-Term Benefit Trust 成员。LTBT 是一个无股权、无利润分配的独立机构,负责监督公司的公共利益使命,Bernanke 将带来其对 AI 经济影响的专业见解。
Hard Questions 是 Anthropic 的倡议,公众可通过此渠道向公司提出最难的 AI 问题,公司承诺透明地追踪并公开报告具体行动。这一倡议基于对 5.2 万名美国人的调查以及来自 159 个国家、使用 70 种语言的 8.1 万名 Claude 用户的意见。
AMD发布了在Instinct GPU上通过ROCm技术栈运行SGLang Diffusion的教程,支持图像生成与编辑扩散模型。SGLang最初因加速大型语言模型而流行,现在将支持范围扩展至图像扩散领域,从而增强AMD在NVIDIA生态之外的AI推理产品竞争力。
FlyDSL 是 AMD 的 Python 领域特定语言,用于编写 GPU 核函数,根据新的 ROCm 指南,其性能可媲美手动优化的 HIP C++ 代码,同时代码量更少。AMD 发布了移植现有 HIP 核函数的实用指南,将 FlyDSL 定位为 NVIDIA CUDA 工具链的 Python 优先替代方案。
来自Meta的PyTorch团队发布了将归一化操作直接融合进GEMM和attention核的技术,旨在消除其计算开销——「免费归一化」。代码已通过核函数库在GitHub上开放,直接效果是加快频繁使用Layer Norm和RMS Norm操作的模型的训练和推理速度。
Ollama 是本地运行开放 AI 模型的平台,宣布获得 8800 万美元融资,投资方包括 Benchmark、Theory Ventures 和 Docker 创始人 Solomon Hykes。该平台服务 890 万开发者和 85% 的财富 500 强企业,云服务每月处理 token 量翻倍。
PyTorch 2.13发布,包含来自526位贡献者的3328个提交。核心亮点:nn.LinearCrossEntropyLoss将LLM训练峰值GPU显存最高降低4倍,Apple Silicon上FlexAttention最高提速12.3倍,新torchcomms后端现代化分布式训练。
CNCF TAG Infrastructure发布白皮书,梳理云原生AI环境中的数据存储瓶颈,区分训练、推理和智能体AI各阶段的需求差异,并为Kubernetes AI/ML工作负载提供架构指南。
IBM与Red Hat将Lightwell Network正式发布,提供超过6500个经数字签名的Java和Python修复依赖项,并推出面向金融服务的Lightwell Clearinghouse Premier,支持补丁封禁协调,背后是50亿美元的开源安全投入承诺。