AWS: SageMaker带来NVIDIA Nemotron 3模型的无服务器微调,支持SFT、RLVR和RLAIF技术
Amazon SageMaker AI推出了NVIDIA Nemotron 3模型的无服务器定制化功能,无需管理基础设施。提供三种技术:SFT(监督微调)、RLVR(可验证奖励强化学习)和RLAIF(AI反馈强化学习),使企业团队无需机器学习基础设施知识即可使用先进的强化学习方法。
192 条新闻
Amazon SageMaker AI推出了NVIDIA Nemotron 3模型的无服务器定制化功能,无需管理基础设施。提供三种技术:SFT(监督微调)、RLVR(可验证奖励强化学习)和RLAIF(AI反馈强化学习),使企业团队无需机器学习基础设施知识即可使用先进的强化学习方法。
GitHub发现,将Copilot代码审查迁移到更好维护的工具后,结果起初变差了——原因不是工具,而是不适配新工具和实际工作流程的过时提示词。通过将提示词重写为diff优先方式(批量发现后再读文件,分析锚定在PR diff上),他们在保持同等质量的前提下将平均审查成本降低了约20%。
Deutsche Telekom与OpenAI签署了将运营商转型为AI原生电信公司的合作协议,应用领域涵盖客户支持、员工工具、网络运营和语音AI。Deutsche Telekom是欧洲最大运营商之一,全球约有2.45亿用户,使此次合作成为电信行业规模最大的AI交易之一。
Claude Code v2.1.206是Anthropic CLI工具的新版本,引入了带路径建议的/cd命令、建议精简CLAUDE.md文件的/doctor检查,以及在/commit-push-pr中自动批准推送到已配置远端的git push功能。后台代理现在在升级后立即更新,无需在下次连接时经历缓慢的升级过程。
Henry Schein One基于Amazon SageMaker开发了「Image Verify」AI系统,用于实时验证牙科X光影像质量。该系统已在10,000多个地点部署,每周处理超过1100万张X光影像,平均延迟1.4秒,旨在减少因影像质量差导致的保险理赔拒绝。
GitHub Copilot 仓库概览是一项新功能,首次访问陌生仓库时自动生成摘要:项目用途、使用的技术以及如何贡献。通过 Copilot chat 在 github.com 上运行,适用于所有 Copilot 计划,无需任何配置。
Reflect 是 Anthropic 的测试版使用习惯分析控制台:显示 1 至 12 个月内 Claude 使用的主要主题、任务类别和时间模式。用户可以设置免打扰时段和休息提醒,适用于已启用 Memory 的 Free、Pro 和 Max 计划用户。
Mistral Studio 为 AI 提示词和技能引入了记录系统:不可变版本控制(含完整历史)、所有权与审计追踪、分类标签以及快速回滚。技能作为 MCP 服务器集成,开发和生产流程相互隔离——生产变更通过 CI/CD 进行。
Amazon Web Services推出适用于AWS的Claude Apps Gateway,这是一个自托管控制平面,使企业团队无需向开发者分发长期凭证,即可集中管理Claude Code和Claude Desktop的访问权限、成本和策略。
OpenAI发布分析报告,对SWE-Bench Pro的可靠性提出质疑——这是2026年评估AI编程助手的主流基准之一。由于基准评分对工具采购和模型选型决策影响重大,这一警告对行业具有直接的实践影响。
Anthropic于2026年7月8日发布Claude Code v2.1.205,新增防止操纵会话记录文件的安全规则,修复了若干问题(包括静默JSON和Windows worktree缺陷),并优化了自动更新机制——现通过流式传输将二进制文件写入磁盘,节省约400 MB峰值内存。
Microsoft Research发布Flint,这是一款开源图表规范语言,通过编译为Vega-Lite、Apache ECharts和Chart.js,用一份紧凑的规范解决了简短与冗长可视化描述之间的取舍,语义数据类型可自动推断坐标轴、格式和配色方案。
施耐德电气拥有107个国家的16万名员工,在AWS EKS上自托管LangSmith以管理60余个AI智能体。架构建立在可观测性、评估和部署三大支柱之上,约有200名活跃用户。内部助手One Jo服务于整个组织,报价工作流从数天缩短至15分钟。
加拿大艾伯塔省政府使用Claude Code(约50个并行AI智能体)在20小时内扫描了4.66亿行代码——若用传统方法完成这项工作需要6.5年。项目涵盖27个部委的1,280个应用程序和3,400个代码库,其中没有一个曾经过系统性安全审查。
Amazon Web Services发布了一套六步流水线,结合Amazon Nova 2 Lite、Meta SAM 3和Amazon Textract服务,从图像中自动去除个人信息(PII)。该解决方案无需训练自有模型,旨在实现对GDPR和PCI DSS标准的合规。
中国研究人员提出PASE——Planning-Aware Semantic自愈引擎,结合LLM规划、符号验证和深度强化学习提示优化。结果:与现有方法相比,云故障平均恢复时间减少40%以上。
Red Hat的Riya Punia在PyTorch博客上解释了为什么CI失败会出现TestMatmulCUDA.test_basic_cuda_float32这样奇怪的名称而非原始的TestMatmul.test_basic——测试是通过设备和dtype组合在导入时生成的。
AWS SageMaker AI发布的多轮强化学习最佳实践指南将奖励函数质量和评估独立性置于算法选择之上。密集奖励可防止方差崩溃,而奖励欺骗则发生在智能体只优化指标而未能真正解决任务时。在SOP-Bench基准测试中,经过正确配置的训练将任务成功率提升了13%,字段精度提升了约16%。
GitHub在同一天发布了两项针对Copilot的企业更新:GitHub Actions中的CLI不再需要个人访问令牌,而成本中心现在支持AI积分池,并配有自动上限以保护各团队之间的资源。
LangChain描述了编码智能体如何因工具碎片化和「令牌至上」心态而产生失控成本,并提出了通过LangSmith平台实现的四阶段解决方案,涵盖可见性、标准化、优化和治理四个方面。
Anthropic 以 Beta 形式推出企业模型权益:组织管理员现可决定用户可访问哪些 Claude 模型,并按用户或组配置努力级别设置。
Anthropic 以测试版形式发布 Claude Science——一款面向基因组学、蛋白质组学及相关领域研究者的独立桌面应用(macOS/Linux),内置 60 余项精选技能,原生集成 NVIDIA BioNeMo 模型,并配备可验证引用和计算结果的审阅代理。
OECD 基于 37 个 GPAI 成员国 SimilarWeb 数据的分析显示,2025 年 1 月至 2026 年 1 月间,生成式 AI 聊天机器人的使用率从约 18% 增至 28%。新加坡以 63% 的采用率领先,25-34 岁年龄段超过 50%,而 Claude 和 Copilot 的用户更倾向于专业工具。
AWS在Amazon Bedrock上演示了扫描文档批量数字化的双阶段流水线方法。Amazon Nova 2 Lite快速廉价地完成初步提取,Claude接手需要空间理解的复杂步骤——这种混合方法比单模型方案节省约三分之二的成本。
GitHub Copilot 智能体 harness 是为模型提供工具和执行循环以实现自主编程的层级。GitHub 在 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.4 和 GPT-5.5 四款模型上通过五项基准测试,验证其任务完成率达到模型厂商 harness 水平,且在大多数配置下 token 消耗更低,并支持 20 余款前沿模型。
第三份Anthropic经济指数报告分析了人们使用Claude的时间规律——从早晨新闻到深夜食谱。Claude Code的自主性评分比聊天高0.37分,高薪职业的对话消耗的令牌数是平均水平的2.5倍。
《迭代LLM代理循环的语义早停》提出了一种方法:一旦连续草稿的嵌入向量停止发生语义变化,即停止代理迭代循环——无需固定步数——从而在质量相同的情况下将令牌消耗减少38%。
将语言模型量化为INT4/INT3可保持答案准确率,但会延长思维链并抵消预期的推理加速效果。微软研究人员引入了CoT Token Inflation Ratio指标,并在数学、代码、科学和智能体任务上进行了测试。
Cliff词元是LLM输出中数学推理成功概率骤降的单个词元。研究人员开发了检测方法,并证明移除首个cliff词元可将准确率恢复至近乎完美的水平,而Cliff-DPO训练可提升+6.6个百分点。
生成式因果测试(GCT)是一个两阶段AI框架,将不透明的大脑活动预测模型转化为可检验的假设——然后通过真实fMRI实验在人类受试者上加以验证。
Huntington Bank借助AWS技术栈(Textract、SageMaker、Step Functions)从逾4亿份文档中清除了个人数据,准确率超过95%,实际成本仅为原始估算的5%,工期从数年缩短至数月。
Talos是一个自动迭代重分析罕见病患者基因组的开源系统。在4,735名未确诊患者中发现241例新诊断(+5.1%),灵敏度达90%,每1,000个基因组注释成本仅11美元。
AWS Bedrock AgentCore推出具有三层隔离(Tier→Tenant→User)的池模型多租户架构,采用Cedar策略控制工具边界,并通过令牌自动售货机实现内存隔离——为生产级AI Agent的SaaS设计提供参考标准。
GPT-5 Pro帮助Jackson Laboratory免疫学家Derya Unutmaz解开了一个困扰三年的T细胞行为谜题——为癌症和自身免疫性疾病研究开辟了新方向。
Vexcel 与 AWS 演示了使用 Amazon Nova 多模态嵌入进行航空摄影语义搜索的方法。在测试约100种配置后,LLM 生成的描述使泳池检测的 F1 分数提高了11%、道路检测提高了13%,并由此发展为可在45个以上国家使用的商业产品 Vexcel Intelligence。
CNCF 博客解释了为何传统系统监控方法不适用于以概率方式运行的 AI 智能体和 LLM 模型——相同的查询可能产生截然不同的结果,错误是语义层面的,而非技术层面的。
UltraQuant是一种针对多轮LLM智能体的KV缓存4位精度压缩技术,由AMD、UCLA和普渡大学联合研发。与FP8基准相比,该技术在高上下文压力的后期轮次中实现了3.47倍更快的P50 TTFT,并将输出吞吐量提升了1.63倍。
Claude Code v2.1.183是Anthropic于2026年6月19日发布的CLI工具新版本,在自动模式下会屏蔽破坏性git命令(git reset --hard、git clean -fd、git stash drop)以及基础设施命令(terraform、pulumi和cdk destroy),除非用户明确请求。该版本还修复了子智能体中的WebSearch问题、全屏界面损坏以及MCP身份验证泄露问题。
Amazon SageMaker是AWS的机器学习平台,现已将100余项详细的生成式AI推理指标发布至CloudWatch,并通过新的Insights监控面板提供访问。面板显示token级延迟(TTFT、token间延迟)、KV缓存跟踪和冷启动诊断,并通过PromQL端点与Grafana和Datadog兼容。
GitHub通过changelog发布了Copilot的三项变更。Opus 4.6 (fast)将于2026年6月29日在所有Copilot界面停用,建议迁移至Opus 4.8 (fast);Copilot code review现在读取仓库AGENTS.md文件;Copilot Usage Metrics API新增ai_credits_used字段,按用户跟踪AI积分消耗。
TxBench-PP是一个通过4800条轨迹、测试11个模型来评估AI智能体在小分子临床前药理学表现的基准测试。Claude Opus 4.8以59.3%的成功率领先,GPT-5.5以55.3%紧随其后,但没有任何模型达到足够可靠的医学应用水平。
MAI-Code-1-Flash——微软定位为同类最佳的紧凑型编程模型——现在可在GitHub Copilot的8个开发界面上使用,从CLI到移动平台,覆盖free到max所有套餐。
OpenAI的推理模型在此前未能确诊的儿童罕见遗传病病例中识别出18个新诊断,并与医生和研究机构展开合作。这些结果为AI在临床诊断中的作用提出了新的问题。
PyTorch核心团队发布了针对Helion内核的LLM引导自动调优方案,将GPU代码优化时间从分钟缩短至秒级。大型语言模型取代穷举搜索,智能引导内核参数空间的搜索过程。
GitHub宣布Copilot桌面应用在macOS、Windows和Linux上正式发布(GA)。该应用带来并行会话、画布界面、云端自动化,以及自定义模型和工具集成。它将GitHub Spark、Copilot Chat和Copilot CLI整合为统一的桌面体验。此次发布是当天更大范围Copilot公告的一部分,包括HyDRA模型路由和面向所有用户开放的Auto模式。
IBM研究表明,91%的组织对自身在供应商、模型和基础设施方面的AI依赖缺乏完整可见性。高达71%的组织难以更换主要AI供应商,81%表示供应商七天停机将造成严重或关键性的业务中断。仅7%的组织具备先进的AI控制能力,但这些组织在应对业务中断时对营业利润的保护能力高出55%。高达72%的组织愿意多支付20%的费用以换取供应商选择灵活性。
Anthropic 发布了 Claude Code v2.1.181,新增 /config key=value 语法可直接在提示中设置配置,同时将 Bun 运行时升级至 1.4 版本。此版本在「思考」阶段 API 连接中断时新增自动重试功能,30 秒后隐藏不活跃的子智能体,并将新环境的启动速度提升 120 毫秒。此外还修复了使用自定义 ANTHROPIC_BASE_URL 和 Foundry 时的提示缓存问题。
Anthropic发布了关于Claude Code智能体编码的经济研究。用户做出约70%的规划决策,而Claude承担约80%的执行决策。专家用户每次提示获得12个动作和3200个词,而初学者仅获得5个动作和600个词,验证任务成功率为28–33%对比15%。调试会话比例从2025年10月到2026年4月间从33%下降至19%,而平均任务价值增长约25%。
AWS在Amazon SageMaker AI中引入了容器镜像预缓存功能,在扩展时无需从ECR拉取镜像,自动启用无需手动配置。对于Qwen3-8B,启动延迟从525秒降至258秒,约51%。用户报告P50延迟降低38~65%,端到端扩展速度最高提升2倍。该功能适用于所有商业AWS区域的所有加速器实例类型。
Google DeepMind、英国政府、Google Cloud与Faculty AI联合开发AI原型,目标将建筑许可审批时间缩短50%。政府目标是在2029年前建造150万套新住房。房主申请占全年申请总量近70%,预计每个议会每年可节省约255小时。该工具目前在Barnet、Camden和Dorset进行测试,计划于2027年全国推广。