Meta在Threads落地精确优先的Agent意图层,统一搜索与推荐场景处理开放式请求。
该系统在Threads中部署,通过一个Agent意图层统一处理搜索与推荐请求。采用精确优先策略,在意图理解阶段识别用户需求,再调度下游检索与生成模块。覆盖开放式请求的解析、意图分类与结果组织。技术材料描述了架构设计以及在产品环境的落地方式。
精确优先的意图层同时覆盖社交平台搜索与推荐,是Meta将Agent能力融入现有产品路径的一个实例。
本周信号转向系统治理:多模态新模型持续推高理解上限,但 Qwen 过度思考、Test-Time Scaling 瓶颈、Snowflake 成本路由等细节,揭示企业场景的真正命题——"如何约束与协调"比"模型多强"更值得衡量。客服、放射科、搜索等垂直场的多 Agent 实践,正在用真实成本作答。
这周其实比较热闹,Open AI也开源了Codex Harness,提供将Codex Harness嵌入到实际的可工作软件中,个人认为也算是正面硬刚DeepSeek Harness,可是DSH的开放性使其可以直接调用Codex Agent。另外一个大新闻就是2026世界机器人大会开幕了,正式从“秀场”走向“考场”,开始进入真正的工作环境,这算是一个标志性的进展。 本周观察到,模型选型与成本控制正从工程细节变成行业显性议题:Snowflake 自动路由降本、DeepSeek 涨价、GLM-5.3 直接亮出 API 定价,几个独立动作在同一周汇成一个信号——智能正在被重新定义为可计量的工业品。另一条线索是 DeepSeek Harness 的开源,同周声音指出它"仍是试验台而非量产方案":开放与不成熟同时发生,基础设施的热度与完成度之间仍隔着一段距离。这两条线彼此对照,恰好构成当下 Agent 生态的横截面。
Meta在Threads落地精确优先的Agent意图层,统一搜索与推荐场景处理开放式请求。
该系统在Threads中部署,通过一个Agent意图层统一处理搜索与推荐请求。采用精确优先策略,在意图理解阶段识别用户需求,再调度下游检索与生成模块。覆盖开放式请求的解析、意图分类与结果组织。技术材料描述了架构设计以及在产品环境的落地方式。
精确优先的意图层同时覆盖社交平台搜索与推荐,是Meta将Agent能力融入现有产品路径的一个实例。
测试时扩展研究对比探索与利用,发现利用是智能体推理瓶颈。
研究者系统评估测试时扩展在真实任务中的表现,将智能体推理策略分为探索与利用两类,并在多组基准任务上逐级增加测试时计算量。结果显示探索带来的成功率提升有限,利用环节的决策质量成为整体性能瓶颈。关键参数包括计算预算层级、任务类型和策略类别。
把测试时扩展的瓶颈从探索转向利用,与常见增加搜索的思路形成对照。
多Agent系统在放射科报告结构化与质控中落地,638例数据,经独立放射科医生评价。
在638例放射科报告上部署多Agent系统,承担报告结构化与质量检查任务。各Agent分工处理报告解析、要素提取与质控校验,并邀请独立放射科医生对输出进行盲评,评估临床可用性。记录了任务分解方式、Agent协作流程与评估协议。
多Agent在医疗文档场景的落地评估方式:用独立临床医生盲评代替自动化指标。
介绍Agentao运行时,本地优先架构,支持工具调用、持久记忆与外部协议。
文章介绍Agentao的设计与实现,面向工具使用型LLM Agent。运行时采用本地优先架构,工具执行与记忆数据保留在本地;治理层对工具调用实施权限控制与审批,支持外部协议对接第三方服务。文中包含系统模块划分、接口定义、调用流程与权限模型的示例。
治理机制内建于运行时,工具调用权限被显式建模而非依赖提示词约束。
提出面向终端和MCP Agent的最小权限学习方法,降低工具调用越权风险。
该方法面向可执行终端命令与MCP工具的Agent,提出任务条件化的最小权限学习机制。Agent根据当前任务内容动态确定所需权限范围,只授予完成该任务必备的工具调用权限,以降低越权操作风险。关键参数包括任务条件表示方式、权限粒度定义与最小权限约束的生成方式。
任务条件化的最小权限,使Agent的工具权限随调用场景动态收敛,而非固定授予全集。
SkillForge 通过自蒸馏让智能体在项目问题修复中沉淀可复用技能。
SkillForge 让 Agent 在修复项目具体 issue 时构建技能库:从解决过程提取可复用步骤,在后续任务中检索并应用。研究在多个软件仓库上运行 issue 修复实验,比较有无技能蒸馏的成功率和修复时间。关键参数包括技能蒸馏阈值、检索匹配方式、技能库条目数量。
技能不是预设能力,而是从项目修复过程里自然沉淀,形成可跨任务复用的项目语料。
论文提出StagedWorkspace,为知识工作Agent提供带版本管理的工作区机制。
论文设计StagedWorkspace工作区,将Agent的持续产出组织为可版本化的阶段,支持暂存、提交、回滚等操作。工作区采用轻量级快照与差异存储管理版本历史,并处理并发冲突。关键参数包括版本粒度、保留策略和覆盖范围。该设计面向知识工作场景,目标是让Agent在长周期任务中可持续累积产出并回溯。
版本化工作区将Agent产出纳入开发者熟悉的版本控制范式,快照与差异存储是工程落地的关键细节。
提出自动诱导评判标准的方法,减少LLM裁判在Agent评估中的过度给分。
文章提出一种无需奖励模型的Agent评估方法,通过从示例轨迹中诱导出结构化评判标准,再用该标准指导LLM裁判打分。方法先对Agent执行过程进行特征提取,生成可复用的评分细则,用于新任务。内容报告了标准生成的具体步骤、覆盖的评估维度,以及与直接打分基线相比的给分分布变化。
评判标准从示例中诱导而非人写,使LLM裁判的给分依据可复现、可审查。
发布 VideoGAIA 基准,用于评测通用 AI 助手在智能体视频理解上的能力。
VideoGAIA 是一个面向通用 AI 助手的评测基准,聚焦智能体视频理解(Agentic Video Understanding)。该基准以视频为输入,要求 AI 助手不仅识别画面内容,还要完成多步推理、交互或行动决策。评测方式围绕视频任务展开,涉及感知、意图推断与动作规划等维度,用于衡量助手在真实视频场景中的整体表现。
该基准把视频理解从感知层提升到智能体行动层,关注看完视频之后如何行动。
探讨编码Agent可靠性,重点在模型外围系统设计,包括harness、检索、记忆与状态管理。
文章围绕编码Agent的可靠性展开,核心议题是模型之外的系统设计。作者将harness、检索、记忆与状态管理视为决定成败的关键组件,并分别讨论其在真实编码任务中的作用与配置方式。文章对上述外围环节进行了系统评估,以展示它们在故障发生时的表现,同时给出运维层面的操作建议。内容并未专注某个模型的内部能力,而是将系统整体作为可靠性优化的对象。
将编码Agent的可靠性归因于模型外围系统,harness、检索、记忆与状态管理被纳入统一讨论,为Agent运维提供了可操作的设计视角。
实证研究编码代理如何在开发中查找、阅读并撰写技术文档。
该研究对编码Agent的实际行为进行实证分析,追踪其在完成编码任务过程中发现文档、阅读文档和更新文档的完整链路。研究的输入为多种代码库与任务,观察记录包含文档查找路径、阅读停留位置以及文档修改触发条件,数据用于归纳Agent友好的文档结构、措辞与链接方式。研究产出为Agent友好文档设计提供参考。
编码Agent与文档的交互行为被系统化记录,Agent友好文档是一个值得关注的产物类型。
提出组合权限、资源、证据等状态化前置控制门,用于Agent执行前安全决策。
该方案在Agent执行动作前设置多个状态化控制门,分别检查权限边界、资源消耗与证据充分性。各控制门的判定结果经组合逻辑形成最终放行决策,避免单一门控造成安全缺口。控制门的状态随会话进展更新,使安全判断依据不断变化而非一次性固化。关键参数包括控制门类型、状态更新机制、组合判定规则与前置检查的执行顺序。
权限、资源、证据三类门控被组合进同一前置流程,并以状态化方式随会话更新。
介绍DeepInsight II评估方法,连接基准测试与机器人部署风险。
内容围绕DeepInsight II方法展开,提出从基准测试到真实机器人的单条评估追踪。核心是将AI物理栈的评估成熟度与部署风险关联,覆盖仿真环境、硬件在环与实体部署阶段,以同一追踪数据对比各环节表现。关键参数包括基准任务集、机器人平台与迁移评估指标。
以单条追踪串联基准与实机,评估成熟度与部署风险直接挂钩。
提出基于声明到证据追踪图的审计方法,核查LLM Agent的工具调用与代码执行。
该论文提出了LEDGER框架,用声明到证据追踪图记录Agent在任务中的每一步声明及其对应的证据链。关键参数包括:追踪图覆盖工具调用、代码执行和外部数据引用;审计过程可追踪从最终输出到原始证据的完整路径;支持自动检测未声明遗漏与虚假引用。适用于需要可审计性的Agent系统。
声明与证据的图结构映射,将模糊推理过程转化为可逐层核查的路径,是Agent审计从黑盒走向结构化的一大看点。
研究2025年专业开发者AI编码智能体使用模式,发现偏重控制
该研究聚焦2025年专业开发者使用AI编码智能体的行为模式,通过分析实际使用案例,识别出开发者倾向于对AI生成代码进行精细控制而非接受随机建议。研究涉及任务分解、代码审查、上下文管理等环节,归纳了控制型工作流的共性与产品设计特征。
专业开发者的控制型使用习惯与大众随性印象形成对比,是编码Agent产品调参方向的直接参考。
刻画Agentic工作负载特征,为推理服务系统设计提供参考。
该研究对比了LLM推理与传统Agentic工作负载在请求到达模式、上下文长度、工具调用频率、并行度等方面的差异,量化了Agent循环对服务调度、KV缓存复用和批处理策略的影响,并据此提出面向Agent场景的服务系统优化方向。
Agentic负载的调度与缓存需求显著区别于传统推理,服务系统设计需重新权衡。
评估分布式系统下编码Agent的代码修复能力,揭示其单进程外调试难题。
该研究针对分布式系统场景构建代码修复评估,通过故障注入测试编码Agent在分布式环境下的调试与修复表现,并与单进程环境进行对比。关键参数包括系统规模、故障类型、修复通过率、修复耗时等。
分布式场景下的调试难题暴露了编码Agent对单进程执行模型的依赖。
提出面向LLM代理的无风险部署方法论,覆盖安全合规与功能风险。
该工作提出一套面向LLM代理部署的无风险方法论,聚焦安全合规与功能风险两类问题。方法论以代理从开发到上线的部署过程为对象,给出风险识别、评估与缓解的处理框架,将风险控制目标设定为消除或降低代理运行中的潜在危害。内容涉及合规审查、行为稳定性、漏洞防护等方面的系统性排查思路,适用于需要将LLM代理投入生产环境的场景。
以“无风险”作为部署目标本身即是强约束,且同时覆盖安全合规与功能风险双维度,这一设定值得留意。
Nemotron 3.5 Lightning上线Amazon SageMaker JumpStart。
Nemotron 3.5 Lightning已可通过Amazon SageMaker JumpStart部署,面向高频AI Agent工作负载。该版本针对吞吐优化,提供快速启动和部署支持。用户可经由JumpStart界面直接调用或微调,面向Agent类应用的规模化推理场景。
模型直接在SageMaker JumpStart提供,高频Agent工作负载可快速部署。
币安推出Agent OS,支持AI代理在平台内执行交易。
币安发布Agent OS,允许AI代理连接Binance账户执行交易操作。系统提供代理创建、授权和监控等管理功能,但代理行为的监督与风险控制责任主要由用户自行承担。涉及代理交易权限范围、资产访问边界、异常操作拦截等关键参数。
交易所将代理行为的监督责任完全置于用户侧,是加密平台对AI代理交易风险的早期姿态。
特斯拉自动驾驶出租车在奥斯汀全无人监督运行,为Cybercab发布做准备。
特斯拉的Robotaxi服务在得克萨斯州奥斯汀以完全无人监督的模式运行,车内无安全员,也无远程人工接管。该运营状态出现在Cybercab正式发布之前,与即将发布的Cybercab形成时间衔接。此次运行发生在奥斯汀公共道路上,涉及自动驾驶出租车的载客运营场景,具体车队规模和运营时段未披露。
全无人监督运行率先落地奥斯汀,且时间节点紧贴Cybercab发布,是自动驾驶出租车去安全员的一次实际运营。
DeepSeek 发布多模态模型,扩展国产模型在 Agent 感知模块的选型空间。
DeepSeek 发布多模态模型,扩展了其文本模型之外的感知能力,为 Agent 系统增加国产多模态选型。该模型可处理图像输入,用于视觉理解、文档解析等感知任务,与现有文本模型形成互补。具体参数与开放方式在摘要中未给出,但该发布意味着国产多模态模型在 Agent 感知模块的可用选项增加。
Agent 感知模块新增一个国产多模态模型选项,是这次模型发布的核心事实看点。
介绍 Fanatics 如何构建多智能体客服系统,处理博彩业务特有需求。
该案例介绍 Fanatics Betting and Gaming 的多智能体客服系统,从规划角度说明系统面临州级规则差异、负责任博彩要求和赛事高峰流量三类约束。内容涵盖智能体任务的划分方式,以及在高并发时段保持服务质量的设计思路,属于博彩行业客服场景下的完整落地记录。
案例同时包含监管合规和流量峰值两个极端条件,是规划多智能体客服的稀缺样本。
Snowflake 发布网关自动路由模型选择,简单 AI 查询成本最高可降至三分之一。
Snowflake 在其平台中新增 AI 网关功能,通过自动路由机制为每一条查询选择合适模型。对于简单查询,系统优先选择低成本模型,避免默认大模型造成超额开销。官方表示该机制最多可为企业降低约三分之二的查询成本。网关面向企业 Agent 调用场景,可在不改变前端接口的前提下实现模型级优化。
自动路由把模型选择从开发期移到运行时,成本优化正在变成基础设施默认能力。
Qwen 3.8 27B模型表现优秀,但默认产生大量过度思考,需控制推理长度来优化成本。
对Qwen 3.8 27B的测试显示,其推理链默认偏长,存在大量与答案无关的中间思考。在多项任务中,限制推理长度后结果质量基本不变,但推理成本显著降低。实际部署需针对任务类型设置不同的推理预算。
模型默认行为与成本敏感场景直接相关,推理长度作为可调参数被单独提出,是Agent成本控制的一个具体支点。
展示 Amazon Bedrock 上结合 Claude 文本分析与 Titan 视觉检索的多 Agent 文档分类方案。
文章实现了一个多 Agent 工作流:一个 Agent 负责对文档进行文本理解与分类,另一个 Agent 使用 Titan 模型进行视觉向量检索,以处理扫描件或图表。通过提示词将文本向量和视觉向量组合,实现更准确的文档归类。包含架构图、关键提示词与 Bedrock API 调用步骤。
文本分析与视觉向量检索的双通道分类,是多模态文档处理在 Agent 工作流中的具体落地。
TrueFoundry开源Agent harness TrueForge,称任务完成成本比Claude Managed Agents低30%-75%。
TrueFoundry发布开源的AI Agent harness TrueForge,用于部署和运行Agent工作负载。官方宣称其任务完成成本比Claude Managed Agents低30%-75%,对比对象为Claude Managed Agents。TrueForge面向需要在自有环境中托管Agent任务的团队,核心参数包括任务完成成本与成本降幅区间。
30%-75%成本降幅为开源harness的对外宣称数据,对比任务类型与计费口径是评估数字适用性的关键变量。
AWS AgentCore 支付功能正式可用,支持 Agent 安全自主交易与预算管控。
AWS 宣布 Bedrock AgentCore 的支付功能正式可用(General Available),使 Agent 能够在自主工作流中安全发起交易。该功能支持对交易对象、金额和预算进行管控,并可与 AgentCore 的执行环境集成,用于规模化自主代理场景。面向生产环境开放后,开发者可直接在 AgentCore 中启用支付能力。
Agent 工具链正式接入支付能力,'预算管控 + 自主交易'成为该功能的突出组合。
Cloudflare推出WriteGuard,为MCP服务器提供细粒度安全控制,目前私有测试。
本文介绍Cloudflare新推出的WriteGuard安全控制,为MCP服务器提供细粒度权限管理,包括对工具调用的精细限制。该功能目前处于私有测试阶段。文章详细说明了WriteGuard如何在不同协议层级进行安全策略配置,并展示了与MCP工作流的集成方式。
MCP服务器安全控制从粗粒度走向细粒度,Cloudflare以基础设施身份介入这一环节。
AWS开源Dogwood,用Cedar扩展策略语言治理Agent工具调用序列。
AWS开源了Dogwood项目,该项目扩展Cedar策略语言,使其能够治理Agent工具调用序列。Cedar原本是AWS用于授权决策的策略语言,Dogwood将其应用范围从单次资源授权延伸至多步骤工具调用流程。开源版本提供策略定义与评估能力,开发者可据此对Agent的连续动作设置约束条件。该方案面向多Agent协作与自动任务执行场景。
看点:Cedar从静态授权扩展到动态工具调用序列治理,策略语言开始覆盖Agent行为轨迹。
发布Palmyra x6技术报告,介绍锚定监督微调的工具调用模型。
技术报告描述Palmyra x6,一个面向企业Agent任务的工具使用模型,采用锚定监督微调(Anchored Supervised Fine-Tuning)进行后训练,以增强Agent在真实业务环境中调用工具的能力。模型定位为agentic,即在多步骤任务中主动选择和使用工具。参数量、训练数据规模等关键参数未在摘要中给出。
锚定监督微调作为后训练策略,强化工具调用约束,是企业级Agent模型一条清晰的技术路线。
OpenClaw智能体接入Bedrock支付,通过x402协议实现自主付费调用API与MCP服务。
该工具使OpenClaw智能体集成Amazon Bedrock AgentCore支付功能,允许智能体在任务执行中自主发起支付。通过配置加密钱包、消费限额和支付策略,智能体可付费访问受保护的API与MCP服务。x402协议定义了支付请求与验证流程,服务端可验证付款后返回响应。提供开发者SDK和示例配置。
智能体以钱包为身份参与交易,x402将支付变成模型可调用的工具。
Bedrock AgentCore的Web搜索新增域名与发布日期过滤功能。
Amazon Bedrock AgentCore为Web Search工具新增domain和publish date两个过滤参数。开发者可以在Agent运行时指定允许检索的域名列表,并限制内容的发布时间范围,从而精确控制检索来源与时效,减少无关或过时信息进入Agent上下文。
过滤参数允许在运行时强制限定检索域名与时间范围,把内容合规要求下沉到Agent基础设施层。
DeepSeek开源Harness运行时,推动Agent基础设施模块化。
DeepSeek将其Harness执行运行时开源,这是支撑AI代理任务执行的底层框架。开源后开发者可脱离DeepSeek模型单独使用该运行时,构建模块化、非绑定的AI Agent基础设施。该运行时支持任务编排、上下文管理、工具调用等关键执行能力。
模型厂商将执行层与模型解耦并开源,是Agent基础设施走向标准化组件的一个标志。
DeepSeek V4 Flash在榜单排名领先,但真实Agent任务完成率仅为53.8%,价格同时大幅上涨。
测评显示DeepSeek V4 Flash在公开榜单中排名靠前,但在真实Agent任务中的完成率仅为53.8%,与榜单成绩存在差距。与此同时,该模型价格出现明显上涨。文章对比了榜单表现与实际任务执行的差异,并列出价格变动数据。
榜单成绩与真实Agent完成率(53.8%)之间的落差,以及价格同步上涨,构成双重看点。
AWS专业服务用Bedrock AgentCore多智能体自动化云迁移全流程
内容描述AWS专业服务团队基于Bedrock AgentCore构建多智能体框架,将云迁移流程端到端自动化,覆盖发现、规划、执行、验证等阶段,由多个智能体分工调用AWS服务与工具,减少人工介入,并记录迁移规模与编排实践。
Bedrock AgentCore作为编排底座,让云迁移流程由多智能体协作驱动,而非单Agent串联任务。
Grab用AI智能体将机械分析工作占比从44%降至30%。
Grab将AI智能体引入机械分析工作流程,通过自动化执行原有人工分析任务,使该工作占总工作量的比例从44%降至30%,下降14个百分点。该实践围绕任务识别、智能体调度与结果整合展开,为运营效率提升提供量化依据。关键参数:机械分析工作占比减少14个百分点,降幅约31.8%。
看点在于用AI智能体直接压缩机械工作占比,以百分点度量落地成效。
Serval将Catalyst转为正式版,用后台代理在工单前发现并修复IT问题。
Serval将Catalyst转为正式版,该超级代理可创建多个后台自主代理,持续监控IT系统、日志和指标,在用户提交工单前主动发现并修复问题。正式版提供与现有IT运维工具的集成能力,支持自定义修复策略与通知机制,旨在减少工单数量和系统停机时间。
自主代理在工单生成前介入修复,将IT运维从被动响应转向主动预防。
Replit推出由GPT-5.6 Luna驱动的免费模式,用户不再担心token成本即可创建软件。
Replit宣布扩展软件创建服务的访问权限,推出由GPT-5.6 Luna模型驱动的免费模式。该模式的核心变化是用户无需再担忧token消耗成本,可以直接通过自然语言完成软件应用的创建。Replit方面表示,此举旨在让没有编程背景的用户也能参与软件开发,将创建能力开放给更广泛的群体。内容包括免费模式的使用范围、模型驱动方式以及对现有付费体系的影响。
免费模式叠加无token成本顾虑,自然语言创建软件的门槛大幅下降,是Agent驱动开发走向大众化的典型样本。
Box 通过 Gemini Embeddings 2 实现多模态企业 Agent,升级内容管理架构。
Box 在内容管理平台中集成 Gemini Embeddings 2,构建可处理文本、图像等多模态数据的企业 Agent。该 Agent 利用嵌入模型实现文档理解、语义检索与内容归类,面向企业知识库场景优化信息提取与推荐流程,是嵌入模型在企业级内容管理系统的落地案例。
Gemini Embeddings 2 参与企业内容理解链路,多模态嵌入模型正成为 Agent 感知层组件。
阿里开源Qwen3.8-27B模型,支持本地运行编码Agent
阿里开源Qwen3.8-27B模型,宣称可在本地运行前沿级编码Agent与推理任务,无需调用云API。模型参数规模为27B,支持离线部署与私有化使用,相关讨论在开发者社区引发关注,可作为本地Agent运行时的模型选型参考。
27B规模本地跑编码Agent,宣称无需云API,为私有化部署场景提供模型侧可选项。
文章介绍让 Agent 学会更有效委托任务的机制,用于多 Agent 协作与规划。
文章以多 Agent 协作为背景,描述 Agent 在执行复杂任务前先判断是否委托、委托给谁以及如何追踪结果。机制围绕委托收益、受托 Agent 能力匹配度与任务验证闭环三个关键参数展开;通过示例说明该机制如何减少任务阻塞,并作为规划层的一种设计模式嵌入 Agent 工作流。
委托机制被拆成可执行的决策点,多 Agent 协作因此更像一种显式工程设计。
DeepSeek涨价被解读为智能工业化信号,涉及模型选型与成本规划。
文章以DeepSeek近期涨价为切入点,讨论AI能力从稀缺技术向标准化工业品转变的趋势。内容结合定价变化,分析模型选型逻辑与长期成本规划,并将这一事件置于AI基础设施商品化的背景中。文章侧重宏观判断。
将一次涨价定义为“智能工业化”节点,而非单纯成本事件,视角少见。
智谱发布GLM-5.3,API定价每百万tokens输入1.4美元、输出4.4美元。
GLM-5.3已通过API开放访问,输入侧每百万tokens定价1.4美元,输出侧每百万tokens定价4.4美元。该版本同时提供网络访问能力,可在模型调用过程中连接外部信息源。价格与网络能力是本次API更新的公开参数。
输入1.4美元、输出4.4美元的定价,加上网络访问能力,构成API层面的两个关键数据点。
网易发布蜜蜂AI社区产品,强调用户需求洞察与模型能力并重。
蜜蜂AI为网易推出的AI社区产品,面向年轻用户群体,将社区形态与AI能力结合。产品设计上同时关注用户需求洞察与模型能力,试图在社区场景中探索AI与年轻化连接的新方式。官方发布信息未披露具体功能细节或技术参数。
网易将社区产品与AI结合,强调需求洞察与模型能力并重,而非单纯技术驱动。
支付宝联合手机、汽车与大模型厂商打造Agent协作生态
支付宝发起一项跨行业协作计划,联合多家手机厂商、汽车厂商和大模型厂商,共同构建一个Agent在不同终端间协作的生态体系,目标是让AI智能够跨设备完成复杂任务。合作涉及移动终端、出行场景和模型能力三个层面的打通。
手机、汽车、大模型三方加入同一Agent生态,入口争夺从单设备转向跨终端协作
百度AI办公产品更名为库库AI,产品逻辑以网盘和文库为底座。
百度将AI办公产品更名为库库AI,该产品以百度网盘和百度文库作为内容底座。网盘提供文件存储与管理能力,文库提供内容资源库,两者共同支撑AI功能的输入与输出。产品定位为办公场景的AI助手,涉及文档处理、信息整理等操作。改名动作反映百度对既有办公产品线的整合,而非从零建立新品牌。
看点:网盘与文库被设为AI办公底座,而非独立知识库,数据来源与产品形态因此绑定。
文章以鸿蒙电脑为例,展示系统级AI如何重塑交互与工作流。
文章介绍鸿蒙电脑的设计理念,其将AI能力整合至操作系统层面,而非单点应用,以系统级交互与工作流重构为特点。文中展示AI在文件管理、跨应用协作等场景的介入方式,作为AI硬件产品的设计案例。具体型号、参数和性能数据未在摘要中提及。
以系统级AI而非应用级AI作为硬件产品核心,将交互与工作流整体纳入AI重构范围,区别于单点功能集成。
报道ChatGPT读取短信等应用数据的新能力。
ChatGPT获得读取短信的权限,可访问用户手机应用中的更多数据。文章围绕AI从App中获取个人信息的现象,讨论权限边界、用户授权机制与数据使用范围,并呈现AI Agent产品在设计时如何处理数据接入的实际情况。
AI Agent开始触碰短信等敏感数据,权限边界成为产品设计中的实际议题。
发布数字人直播Agent技术报告,核心是Agent与Harness协同演进的工程方法。
技术报告描述数字人直播Agent的工程架构,提出Agent与Harness协同演进方法:Harness提供工具、上下文和反馈通道,Agent在运行中根据反馈调整行为。报告给出了直播场景下的模块划分、状态管理和人工介入接口,并说明在线迭代流程。
Agent与Harness协同演进,把工程层和模型层绑定为可迭代闭环。
谷歌扩展 Antigravity 企业版 Agent 平台,面向企业客户开放。
谷歌宣布扩展 Antigravity 企业版 Agent 平台的开放范围,面向企业客户提供更便捷的接入方式。官方表示此次扩展是回应开发者对易用性的需求,后续企业用户可在更多环境中部署并使用该 Agent 平台。
看点在于企业版 Antigravity 对“便捷接入”的重视:企业采用 Agent 平台的瓶颈可能不在能力,而在接入与部署方式。
分析Token经济变化下Agent从开源工具走向本地自研的演进路径。
该分析以 OpenClaw、Hermes 等开源工具为起点,梳理 Agent 在 Token 经济变化下走向本地自研的演进过程。内容覆盖 Token 计费与成本结构变化对技术选型的影响,以及本地自研带来的架构决策差异,涉及工具链切换、资源投入和长期维护等因素。关键参数包括从 OpenClaw 到 Hermes 再到本地自研的路径节点。
Token 经济变化被作为 Agent 选型从开源工具转向本地自研的关键分析线索。
提供零基础使用DeepSeek Harness构建Agent的教程。
以零基础为起点,演示通过DeepSeek Harness以搭积木方式构造Agent的具体步骤。教程覆盖环境搭建、模块选择与组合方法,展示如何利用该工具快速搭建可运行的Agent原型,供开发者参考实践。
模块化拼装Agent的开发方式,降低原型搭建门槛。
DeepSeek Harness被指仍是试验台而非量产方案,反映Agent框架成熟度不足。
DeepSeek Harness被业内评论为试验台而非量产方案。该框架被定位为Agent开发支持工具,但评论认为其成熟度未达生产标准。讨论聚焦于Agent框架在真实业务场景中的可靠性,指出当前版本更适合概念验证而非承担线上任务。文章将这一现象归因于Agent领域整体处于早期阶段。
看点:Agent框架的试验台与量产方案差异成为焦点,生产环境对确定性要求高于实验室场景。
探讨软件工厂中人类判断的角色变化,从执行层转移到监督与决策层。
这篇文章从工程管理角度讨论了软件交付流程中人类判断的位置变化。核心论点是人类判断并未退出软件开发过程,而是从具体执行环节上移到更高层级:由人来做方向性决策、结果审核和异常处置,将可重复的、模式化的判断交给自动化系统。文章梳理了这一迁移对团队分工、流程设计和质量保障机制的影响。
将人机边界定义为判断层与执行层的迁移,而不是简单的自动化取代,对Agent产品的能力边界设计有参照。
参观通用机器人公司,机械臂现场用香蕉作工具完成操作,展示具身智能学习能力。
文章记录访问通用机器人公司的见闻,展示一台机械臂在无预先编程情况下,临时拿起香蕉作为工具完成目标,体现机器人现场学习和适应环境的水平。内容关注具身智能从固定流程走向更开放的实时学习,说明机器人不再只依赖模型预训数据,也依赖现场反馈和任务上下文。
用香蕉当工具只是演示,真正看点是非结构性环境中如何即时扩充机器人的动作库。
2026世界机器人大会聚焦场景落地,行业共识从表演转向实际应用。
报道指出,机器人行业已形成从表演性展示转向场景落地的共识。2026世界机器人大会聚焦机器人在实际场景中的应用,展示物流、制造、服务等领域的落地案例,并围绕技术成熟度、商业闭环等议题展开讨论,反映行业正从炫技转向解决真实问题。
机器人行业共识从表演转向场景落地,2026大会成为观察商业化方向的窗口。
探讨 AI Agent 实际需要的记忆容量,分析任务场景下的记忆配置策略。
文章围绕 AI Agent 记忆容量设计展开,分析任务复杂度、上下文依赖性与长期学习需求对记忆大小的影响。比较了短期工作记忆与长期存储的权衡,提出了容量估算方法与分场景配置策略,并给出不同任务类型的参考区间。
记忆容量选择需匹配任务复杂度与上下文依赖,单一尺寸方案不适用;长期与短期记忆的权衡是规划重点。
教程介绍用161个新闻源构建AI主编的完整实操过程。
作者以161个新闻源为输入,构建了一个AI主编Agent,用于自动判断与筛选重要新闻。教程包含数据源配置、内容聚合与排序逻辑等步骤,并附带效果对比。文章采用教程体,呈现内容聚合类Agent的搭建过程。
以161个新闻源为输入,将“大新闻”判断标准流程化,是内容聚合类Agent的具体样本。
独立创始人用Codex与ChatGPT的计算机使用能力推出时尚品牌并完成电商搭建
文章讲述独立创始人 Yana Welinder 在无工程师支持的情况下,利用 OpenAI Codex 和 ChatGPT 的计算机使用能力完成时尚品牌的创建与电商平台搭建。涉及的技术环节包括代码生成、界面操作与自动化流程。
看点:单个创始人借助 AI 智能体完成原本需要开发团队的电商搭建流程。
十年知乎写作者 · CSDN 博客专家
10 余年架构设计经验 · AgentHui 站长
用人文视角观察 AI Agent 技术演化,每天记录值得关注的信号与变化。 本站是我用「人 + AI 协同」搭建的实战场。
公众号
加微信