当前位置:首页 >专题 >OpenTelemetry GenAI 与 Agent 可观测性工程专题

OpenTelemetry GenAI 与 Agent 可观测性工程专题
OpenTelemetry GenA

OpenTelemetry GenAI 与 Agent 可观测性工程专题

从模型调用、Agent Trace 到 OTLP 管道与上线治理
AI 应用上线后,真正难排查的往往不是模型能否返回结果,而是一次任务经过了哪些模型、工具、检索和人工确认,以及延迟、token、错误和隐私风险发生在哪一段。本专题以 OpenTelemetry GenAI 语义约定和 Go 生态为主线,帮助开发者把 Agent 执行链路变成可检索、可度量、可复盘的工程数据。

Agent 追踪与工程排障

从工具调用证据到权限、超时、交接和上下文治理

AI Agent Tracing 实战:工具调用、护栏和人工确认怎么追踪
文章

AI Agent Tracing 实战:工具调用、护栏和人工确认怎么追踪

把模型、工具、护栏、人工确认和最终结果拆成 trace 与 span,支持调试和复盘。
AI Agent 工具调用失败排查:从 Schema 到超时兜底的完整工作流
文章

AI Agent 工具调用失败排查:从 Schema 到超时兜底的完整工作流

从 Schema、参数校验、权限、超时、重试和空结果定位工具调用失败。
MCP 服务接入工作流:从工具清单到权限审计的 AI Agent 落地路线
文章

MCP 服务接入工作流:从工具清单到权限审计的 AI Agent 落地路线

从工具清单、调用链、权限审计和失败恢复梳理 MCP 服务接入流程。
AI Agent 工具调用怎么落地:权限闸门、审批链路和上线观察指标
文章

AI Agent 工具调用怎么落地:权限闸门、审批链路和上线观察指标

围绕工具权限、审批、发布和观测指标建立 Agent 上线控制链路。
AI Agent 工具权限分级实战:读、写、发布三类操作怎么管
文章

AI Agent 工具权限分级实战:读、写、发布三类操作怎么管

按读、写、发布分级工具权限,并结合人工确认和审计记录降低越权风险。
AI Agent 交接跑偏怎么办:从意图检查到交接摘要一步步排查
文章

AI Agent 交接跑偏怎么办:从意图检查到交接摘要一步步排查

分析多 Agent 交接中的意图、摘要、上下文和结果偏差,并给出排查路径。
AI 代理工具结果太大怎么办:Go 用引用句柄隔离上下文与原始响应
文章

AI 代理工具结果太大怎么办:Go 用引用句柄隔离上下文与原始响应

用引用句柄隔离大工具结果,降低上下文膨胀并保留原始响应访问路径。

GenAI 可观测性常见问题

字段、隐私、采样与上线验收的实用答案

AI Agent 一次任务应该拆成哪些 span?

至少区分任务、模型调用、工具调用、检索、护栏和人工确认;跨服务时通过上下文传播连接父子关系,并为每段记录状态、耗时和错误。

要不要把完整 Prompt 和模型回复写进 Trace?

默认不应记录完整内容。优先保存模型、token、耗时、长度、哈希、模板版本和脱敏摘要;确需采样时要设置权限、保留期和开关。

OpenTelemetry GenAI 字段还在变化,生产怎么用?

区分 stable、development 和 experimental 字段,封装业务自己的映射层,记录 schema URL 与版本,并在 Collector 或后端升级前做回归。

Agent Trace 上线验收至少看哪些指标?

至少观察任务成功率、模型和工具错误率、端到端延迟、各 span 延迟、token 与成本、重试、人工接管、拒绝和上下文溢出。

微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码