该产品与 AMD Advancing AI 2026 同步发布,面向采用 AMD EPYC CPUs、AMD Instinct GPUs 及经 Red Hat OpenShift 验证的受治理代理式 AI 部署。
Embedded LLM 已推出 TokenVisor Spaces,这是一款面向 AMD 驱动的 AI 云和企业部署的新产品,将代理执行、模型推理、策略控制和可审计工作区打包为一项受治理的代理式 AI 服务。该产品与 AMD Advancing AI 2026 同步推出,旨在让 AI 云运营商和企业能够在 AMD 服务器基础设施上运行长生命周期的 AI 代理,其中执行运行于 AMD EPYC x86 CPUs,推理运行于 AMD Instinct GPUs。 该公司表示,该产品旨在填补企业 AI 部署中的一个现实空白:代理不仅需要原始 token 生成能力,还需要持久化工作区、工具访问、审批、策略执行、计量和审计追踪。TokenVisor Spaces 提供隔离容器,用于 shell 访问、文件、代码、浏览器自动化及工具,并配备人工审批工作流、可重放事件历史,以及通过 TokenVisor 实现的受治理模型访问。Embedded LLM 表示,该产品已在 Red Hat OpenShift(基于 Kubernetes 的容器平台)上完成验证,其中 OpenShift 管理容器和 GPUs,而 TokenVisor 负责权限、路由、预算、速率限制、计量和可审计性。 Embedded LLM 还强调了 KV-cache 复用的经济性,即复用已存储的模型上下文,以避免对提示词进行重复计算,这对于长时间运行的代理尤为重要。该公司援引 SemiAnalysis 的数据称,在 1.5M+ 次 Claude Code 请求中,约 95% 的所有 tokens 为缓存读取,使提示 token 成本下降约 84%。在另一项基于 AMD Instinct MI355X GPUs、采用 vLLM、LMCache ConnectorV1、AMD hipFile/GDS 和原生本地 NVMe 的基准测试中,该公司报告称,与匹配的 vLLM HBM prefix-cache 基线相比,预热轮次的中位延迟降低 3.31x,总体墙钟时间加快 2.23x。 此次发布还伴随与 VAST Data 和 Tensormesh 的合作,围绕平台级 KV-cache 复用、代理状态、追踪捕获、回放与评估,以及 RL(强化学习)数据展开。TokenVisor Spaces 现已面向 AI 云运营商、私有 AI 环境和本地部署企业开放合作伙伴部署与评估。