VictoriaMetrics AI 工具生态:MCP Server、Agent Skills 与 OpenTelemetry AI 可观测性集成指南
【免费下载链接】VictoriaMetricsVictoriaMetrics: fast, cost-effective monitoring solution and time series database项目地址: https://gitcode.com/GitHub_Trending/vi/VictoriaMetrics
导读
本指南以仓库 docs/ai-tools/README.md 为主体,系统梳理 VictoriaMetrics Observability Stack 面向 AI 助手与自动化工具的三类集成能力:通过MCP(Model Context Protocol)Server向 AI 智能体结构化暴露指标、日志、链路追踪与异常检测能力;通过Agent Skills为 AI 智能体提供预定义的可观测性工作流;并基于原生OpenTelemetry(OTLP)接入构建面向 AI 应用自身的可观测性。读完本文,你将掌握 VictoriaMetrics 全套 AI 集成组件的功能边界、vmanomaly UI Copilot 的启用与配置方法,以及如何在当前仓库源码中找到对应实现。
一、集成总览:AI 助手如何接入 VictoriaMetrics
VictoriaMetrics Observability Stack 通过两类途径与 AI 助手协作:
- MCP Servers:以结构化方式向 AI 智能体暴露可观测性数据与运维能力,使智能体能够查询遥测数据、分析系统行为,并在排障与调查工作流中协助工程师;
- Agent Skills:为 AI 智能体和自动化工具提供"如何理解、操作并排障 VictoriaMetrics 各组件"的预定义工作流。
与此同时,由于 VictoriaMetrics、VictoriaLogs、VictoriaTraces 分别对 OpenTelemetry 的指标、日志、链路三大信号提供原生接入支持(详见 docs/opentelemetry/README.md),任何能够以 OpenTelemetry 格式发出遥测信号的 SDK 或 AI 助手,都可以无缝接入 VictoriaMetrics 栈,这使得该栈成为AI 可观测性(AI observability)场景的理想后端。
仓库中该主题的唯一入口文档为 docs/ai-tools/_index.md,其正文通过{{% content "README.md" %}}直接嵌入上表所列内容,以下各节均围绕它展开。
二、MCP Servers:把可观测性能力交给 AI 智能体
MCP(Model Context Protocol)Server 将可观测性数据和运维能力以结构化、标准化的方式暴露给 AI 助手,从而支持智能体查询遥测数据、分析系统行为,并在故障调查与排障流程中充当工程师的得力助手。VictoriaMetrics 目前提供四个官方 MCP Server,分别对应指标、日志、链路与异常检测四类场景,均为独立于本仓库的配套项目。
2.1 VictoriaMetrics MCP Server(指标)
面向 VictoriaMetrics 实例提供访问能力,与 VictoriaMetrics API 及官方文档深度集成,为工程师与工具提供完整的监控、可观测性与调试交互接口。其能力包括:
- 查询指标与探索数据(若客户端支持,还可直接绘制图表);
- 列出并导出可用的指标、标签、标签值以及完整时间序列;
- 分析与测试告警规则和 recording rules 及其告警;
- 展示 VictoriaMetrics 实例的运行参数;
- 探索数据的cardinality与指标使用统计;
- 分析、追踪、美化并解释查询语句;
- 调试relabeling 规则、下采样(downsampling)与保留期(retention)策略配置;
- 集成 VictoriaMetrics Cloud。
2.2 VictoriaLogs MCP Server(日志)
面向 VictoriaLogs 实例提供访问能力,与 VictoriaLogs HTTP API 及官方文档集成,为日志处理、可观测性与调试任务提供完整接口。其能力包括:
- 查询日志与探索日志数据;
- 展示 VictoriaLogs 实例的运行参数;
- 列出可用的日志流(streams)、字段(fields)与字段值(field values);
- 将日志查询统计作为指标输出(logs-as-metrics)。
2.3 VictoriaTraces MCP Server(链路追踪)
面向 VictoriaTraces 实例提供访问能力,使 AI 助手与工具能够与分布式追踪数据进行交互,服务于可观测性与调试任务。其能力包括:
- 获取服务与操作(span names)列表;
- 查询链路(traces),探索并分析链路数据。
2.4 vmanomaly MCP Server(异常检测)
与 vmanomaly 的 REST API 及文档无缝集成,用于 AI 辅助的异常检测、模型管理与可观测性洞察。其能力包括:
- 检查 vmanomaly 的健康状态、构建信息、兼容性与自监控指标;
- 检查模型 schema,校验模型或完整服务配置;
- 对采样查询结果进行画像分析(趋势、季节性、变点、数据缺口、间歇性行为);
- 运行异步自动调优(autotune)任务,并将其结果转化为数据驱动的模型推荐;
- 生成完整的 vmanomaly YAML 配置以及 vmalert 告警规则;
- 对内置 vmanomaly 文档进行模糊匹配检索。
提示:上述 MCP Server 均以 HTTP 或 streamable 模式运行,供支持 MCP 的 AI 客户端(如 Claude Code、各类 IDE 插件等)连接。它们与当前仓库的解耦关系意味着:仓库内的 vmanomaly 相关文档 与 UI 文档 是理解这些 MCP Server 行为的本地依据。
三、vmanomaly UI Copilot:内置 AI 助手
在 MCP Server 与 Agent Skills 之上,vmanomaly 的 Web UI(自 v1.26.0 起内置,默认端口 8490)还提供了内置 AI 助手Copilot(自 v1.29.0 起可用)。它能够理解用户在 UI 中的当前异常检测配置,帮助用户在不离开 UI、不手动翻文档、甚至无需成为异常检测专家的情况下更快迭代并获得更好的检测结果。
3.1 Copilot 能做什么
- 针对任意模型提问:例如 Temporal Envelope、Online Seasonal Quantile、Online Z-score 等模型的参数、取舍与适用场景;
- 改进检测质量:描述问题(如"误报太多""漏掉了尖峰"),Copilot 会读取当前配置、检索文档并给出经过校验的配置修改建议;
- 内联配置建议:建议以带解释和 YAML diff 的交互卡片呈现,点击Apply直接写入当前设置,或点击Decline继续对话;
- 画像并调优真实查询(自 v1.30.0 起):当连接了 mcp-vmanomaly 时,Copilot 可检查有界时间序列特征、推荐在线模型、启动异步 autotune 任务并应用其校验过的查询与模型建议。
3.2 启用与配置 Copilot
AI Assistant 默认关闭,需要显式启用并配置 LLM 提供商凭据与模型:
# 启用 Copilot export VMANOMALY_COPILOT_ENABLED=true # 显式指定模型(不要依赖隐式默认模型) export VMANOMALY_COPILOT_MODEL=openai:gpt-5-mini支持的提供商与模型格式(详见 docs/anomaly-detection/UI.md 的 "AI Assistance" 一节):
| 提供商 | 所需环境变量 | 模型格式示例 |
|---|---|---|
| Anthropic | ANTHROPIC_API_KEY | anthropic:claude-sonnet-5 |
| OpenAI | OPENAI_API_KEY | openai:gpt-5-mini、openai-responses:<model> |
| OpenAI 兼容(非 OpenAI) | OPENAI_BASE_URL+OPENAI_API_KEY | openai:<model> |
| Azure OpenAI | AZURE_OPENAI_ENDPOINT+OPENAI_API_VERSION+AZURE_OPENAI_API_KEY(或AZURE_OPENAI_AD_TOKEN) | openai:<model> |
| Google(GLA/Vertex) | GOOGLE_API_KEY或GOOGLE_APPLICATION_CREDENTIALS | google-gla:gemini-2.5-pro-preview |
| AWS Bedrock | AWS_BEARER_TOKEN_BEDROCK+AWS_DEFAULT_REGION(或 AK/SK + IAM) | bedrock:anthropic.claude-sonnet-4-5-20250929-v1:0 |
| OpenRouter | OPENROUTER_API_KEY | openrouter:anthropic/claude-sonnet-4-5 |
注意:
OPENAI_BASE_URL与AZURE_OPENAI_ENDPOINT不可同时设置。
3.3 连接 MCP 工具服务器
Copilot 通过VMANOMALY_MCP_SERVER_URL连接 mcp-vmanomaly 以获得完整工具能力(内置文档、模型配置与校验、告警推荐、服务健康检查等),仅支持 HTTP 模式,且 MCP Server 必须能从 vmanomaly 容器内访问:
export VMANOMALY_MCP_SERVER_URL=http://localhost:8081/mcp若 vmanomaly 运行在 Docker 中,应将两个容器置于同一网络并按容器名互相访问,例如:
docker network create vmanomaly-network docker run -d --rm \ --name mcp-vmanomaly \ --network vmanomaly-network \ -e VMANOMALY_ENDPOINT=http://vmanomaly-instance:8490 \ -e MCP_SERVER_MODE=http \ -e MCP_LISTEN_ADDR=:8081 \ ghcr.io/victoriametrics/mcp-vmanomaly docker run -it --rm \ --name vmanomaly-instance \ --network vmanomaly-network \ -e VMANOMALY_COPILOT_ENABLED=true \ -e OPENAI_API_KEY="$OPENAI_API_KEY" \ -e VMANOMALY_COPILOT_MODEL=openai:gpt-5-mini \ -e VMANOMALY_MCP_SERVER_URL=http://mcp-vmanomaly:8081/mcp \ -p 8080:8080 \ -p 8490:8490 \ victoriametrics/vmanomaly:v1.30.4 \ vmanomaly_config.yaml3.4 Copilot 的工作机制与最佳实践
Copilot 以聊天弹窗形式锚定在页面右下角,面板可通过拖动左边缘调整大小。它是上下文感知的:会自动读取 UI 中的活动模型、调度器与异常检测设置,无需手动粘贴配置;自 v1.29.2 起,还可读取和修改完整 UI 设置(数据源 URL、查询参数、调度器设置等),从而给出更贴合上下文的建议。实际调试经验(来自 UI 变更记录)显示,Copilot 建议与模型向导、生成的模型配置之间保持同步,并能在工具调用被取消或不完整时优雅恢复。
四、Agent Skills:预定义的可观测性工作流
Agent Skills 帮助 AI 智能体与自动化工具理解、操作并排障 VictoriaMetrics 的观测组件,覆盖指标、日志、链路与 vmanomaly。这些技能提供预定义工作流,例如:
- 查询指标、日志、链路与告警;
- 链路查询分析(trace analysis);
- 多信号联合调查(multi-signal investigations);
- Cardinality 优化;
- 未使用指标检测;
- 流式聚合(stream aggregation)配置;
- 依据实测时间序列特征(季节性、变点、趋势)构建经校验的 vmanomaly 配置;
- 查询与操作 vmanomaly API;
- 基于真实数据审查既有异常检测配置,识别误报与模型-数据拟合问题。
安装方式(面向 AI 代理的环境):
npx skills add VictoriaMetrics/skills安装完成后,AI 智能体即可按技能提供的步骤执行上述调查与优化工作流。在仓库内,与技能覆盖能力对应的本地参考包括:流式聚合文档、vmalert 文档 以及 异常检测系列文档。
五、AI observability:用 OpenTelemetry 观测 AI 应用本身
5.1 三大信号,三大专用后端
VictoriaMetrics 栈为 OpenTelemetry 的每种信号类型提供了专用数据库(见 docs/opentelemetry/README.md):
- VictoriaMetrics→ Metrics(指标)
- VictoriaLogs→ Logs(日志)
- VictoriaTraces→ Traces(链路)
每个数据库针对自身信号与使用场景做了专门优化,兼顾可维护性与效率。各组件均支持通过 OpenTelemetry Protocol(OTLP)从 OpenTelemetry Collector 与 SDK 接入数据:单节点版、vmagent、vminsert 支持指标;VictoriaLogs 单节点版、vlagent、vlinsert 支持日志;VictoriaTraces 单节点版与 vtinsert 支持链路。
5.2 源码级验证:OTLP 指标接入链路
在仓库中,OTLP 指标的接入实现位于 app/vminsert/opentelemetry/request_handler.go 与 app/vmagent/opentelemetry/request_handler.go。从源码结构可以确认:
- 入口
InsertHandler接收 HTTP 请求,通过Content-Type区分 JSON 与 protobuf 编码,其中 JSON 仅用于 AWS Firehose 协议(X-Amz-Firehose-Protocol-Version头),其余场景要求 protobuf 编码; - 请求会应用 extra labels(
protoparserutil.GetExtraLabels)并支持Content-Encoding(gzip/zstd 等压缩); - 解析后的数据经 lib/protoparser/opentelemetry 进入统一写入管线;
- 埋点指标(如
vm_rows_inserted_total{type="opentelemetry"})可用于观测 OTLP 摄入量。
类似的,日志的 OTLP 接入由 vlinsert/vlagent 组件承担,链路则由 vtinsert 承担。这意味着:任何能产出 OTLP 信号的 AI 应用或 SDK,都可以直接接入这套栈。
5.3 应用场景:AI Agent 与 AI 编码工具的观测
官方文档明确了两类高价值场景:
- AI Agent 观测:使用 OpenLLMetry、OpenInference、OpenLIT 等自动埋点库监控 AI 智能体。基于 OpenTelemetry 的三信号支持,任何 SDK 或 AI 助手都能接入;
- AI 编码工具观测(vibe coding observability):Claude Code、OpenAI Codex、Gemini CLI、Qwen Code、OpenCode 等 AI 编码助手会暴露内部遥测,有助于监控成本消耗、分析、性能、合规性并改善排障体验。这些主流 AI 编码工具均支持 OpenTelemetry,可轻松接入 VictoriaMetrics 栈。
仓库中的 OpenTelemetry 接入指南 提供了从采集到查询的完整实践路径,是落地上述场景的首选参考。
六、小结与选型建议
| 场景 | 推荐组件 | 本地参考文档 |
|---|---|---|
| AI 智能体查询指标并调试规则 | VictoriaMetrics MCP Server | url-examples.md |
| AI 智能体查询日志/链路 | VictoriaLogs / VictoriaTraces MCP Server | OpenTelemetry 指南 |
| UI 内 AI 辅助异常检测建模 | vmanomaly UI Copilot + mcp-vmanomaly | UI.md |
| 多信号联合调查、cardinality 优化等自动化工作流 | Agent Skills | 异常检测文档 |
| 观测 AI 应用/编码助手自身 | OTLP 接入 + 三大后端 | getting-started-with-opentelemetry |
实际落地时,建议按"先由 Agent Skills 完成自动化调查工作流,再由 MCP Server 提供细粒度交互能力,最后通过 vmanomaly UI Copilot 在 Web 界面内完成模型迭代"的分层方式组合使用,以覆盖从排障到建模的完整 AI 辅助闭环。
【免费下载链接】VictoriaMetricsVictoriaMetrics: fast, cost-effective monitoring solution and time series database项目地址: https://gitcode.com/GitHub_Trending/vi/VictoriaMetrics
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考