英特尔平台 Day 0 支持 Meta Muse Glimmer 本地智能体 AI

openlab_96bf3613 更新于 9小时前

原文标题:Day 0 Local Agentic AI Support on Intel Platforms with Meta's Muse Glimmer

原文出处:https://www.intel.com/content/www/us/en/developer/articles/community/day-0-local-agentic-ai-with-meta***use-glimmer.html

版权所有 © Intel Corporation。本文档为原文的中文翻译件,仅供内部阅读与技术参考;对外发布或转载前请先取得版权方授权。


随着 AI 能力的持续演进,英特尔®始终致力于让自身平台紧跟最新的模型创新步伐,把强大的 AI 体验带给每一个人。今天,英特尔非常自豪地宣布对 Muse Glimmer 的支持——这是 Meta 推出的一款全新多模态开放权重 AI 模型,其设计核心即面向智能体(agentic)应用。作为 Meta 的可信合作伙伴,英特尔与 Muse Glimmer 团队紧密协作,确保开发者能够在英特尔硬件上获得经过优化的体验。若想进一步了解 Muse Glimmer,请查阅 Meta 的官方博客

什么是 Muse Glimmer?

Muse Glimmer 是一款拥有 300 亿参数的开放权重模型,由 Muse Spark 蒸馏而来,专为常驻式(always-on)本地智能体工作流而优化。它足够轻量,可以在一台 PC 或单张消费级 GPU (例如 Intel® Arc™ Pro B70)上运行,从而支撑从本地智能体、函数调用,到本地编码与合成数据生成等多种用例。这些能力共同使 Muse Glimmer 成为一个有力的基础,用于构建响应灵敏、智能的端侧 AI 助手——快速、私密且高效。在关键的智能体用例与基准测试中,相较同参数量级的领先模型,它展现出强劲的表现。

英特尔在广泛的硬件产品线上支持 Muse Glimmer:从搭载 Intel® Core™ Ultra 3系列集成显卡的消费级笔记本电脑,到配置 Intel® Arc™ Pro B70 独立显卡的工作站,再到 Intel® Xeon® 处理器,确保开发者与企业能够在任何工作流需要的地方部署 Muse Glimmer。

为智能体工作流而生

Muse Glimmer 从底层设计之初就面向常驻式智能体工作流,而不只是聊天对话。该模型能够处理大量连续的工具调用、从失败中恢复,以及多模态、多步骤推理,其可靠性足以在本地硬件上连续数小时甚至数天地执行复杂的多步智能体任务。此外,Muse Glimmer 还经过训练以抵御来自不可信内容的提示注入(prompt injection),从而降低外部内容劫持智能体行为的风险。

开放且对开发者友好

对开发者而言,Muse Glimmer 提供了最大程度的灵活性。它以 Apache 2.0 协议发布,是 Meta 迄今为止最为宽松的开源模型。该模型针对主流开源框架进行了优化并获得合作伙伴支持,开发者可以使用自己已经熟悉的工具,在几分钟内从下载模型走到跑通一个可用的智能体。

英特尔上的本地优先智能体 AI:保护数据并优化 AI 效率

智能体 AI 的兴起,代表了开发者构建与部署智能应用方式上最重大的转变之一。与传统的 AI 交互不同,智能体 AI 系统会跨多个步骤进行规划、推理与行动,在此过程中使用工具、管理记忆,并实时适应新信息。

英特尔让开发者能够在当下就于本地基础设施上构建并部署有能力、可信赖且具成本效益的 AI 智能体。通过日益壮大的软件工具生态——包括 OpenVINO™ 工具套件、SuperClaw 以及广泛的上游框架支持——英特尔为智能体 AI 应用的开发与部署提供了一条兼顾隐私性、性能与运营效率的优化路径。

使用 Muse Glimmer 可以构建什么?

以下是开发者今天就可以在英特尔硬件上构建并部署的一些示例。

借助本地 AI 编码智能体进行全栈应用开发 | Intel® Arc™ Pro B70

本演示展示了 Muse Glimmer 在端到端编码工作流中的本地智能体能力,全过程完全运行在一块拥有 32GB 显存的 Intel® Arc™ Pro B70 GPU 上。借助 Cline——一款直接集成于 VS Code 的 AI 编码智能体,并由通过 llama.cpp 服务器在本地运行的 Muse Glimmer 驱动——开发者可以私密地构建、迭代并交付全栈应用,且无需任何云端成本。

它做了什么

仅凭一条自然语言提示,Muse Glimmer 就通过 Cline 生成了一个完整的客户反馈分流(Customer Feedback Triage)应用。生成的应用包括:

  • 一个 React + Vite + Tailwind CSS 前端,包含两个视图:面向公众的客户反馈表单,以及私有的管理员分流仪表板

  • 一个 Node.js + Express REST API 后端,使用 SQLite 进行存储

  • AI 驱动的情感分析(正面 / 负面 / 中性),同样路由到该本地模型处理

  • 一个一键启动脚本,可同时拉起整个技术栈

  • 整个过程约产生一百万 token 的提示、推理与生成代码,而成本为零:无需云订阅、无需 API 密钥,也没有任何数据离开设备。

演示视频

全栈编码智能体本地运行(Fullstack Coding Agent Running Locally)视频

基于 Hermes 智能体的应用性能优化器 | 双 Intel® Arc™ Pro B70

本演示重点展现了 Muse Glimmer 如何支撑一个完全运行在英特尔硬件上的端到端性能工程智能体。Muse Glimmer 由 vLLM 在双 Intel® Arc™ Pro B70 GPU 上提供服务,并由运行在 Intel® Core™ Ultra 系列客户端上的 Hermes 智能体驱动,源代码与基准测试数据始终不离开本地网络。

它做了什么

当开发者报告某个应用在高负载下性能劣化时,Hermes 智能体会自主接管,运行一整套通常需要工程师投入一整天工作量的性能工程闭环:

  • 源码驱动的测试设计:读取应用代码,自主发现其路由与鉴权要求,并编写带有正确性断言的分阶段 k6 负载脚本

  • 在优化任何一行代码之前,先记录基线并确定阈值**

  • 针对正在运行的服务器进行实时负载测试,基于真实的 k6 负载而非估算值进行推理

  • 产出优化后的应用版本,包含缓存、确定性延迟与 keep-alive 调优,所有功能检查以 0% 错误率通过

一次完整运行大约耗时 20 分钟,历经数十次工具调用、两轮完整的 k6 负载测试,最终交付五项产物:基准测试脚本、基线报告、优化后的应用、对比报告以及 SVG 流程图——全部在本地处理,无任何外部依赖。

演示视频

性能优化器演示(Demo Performance Optimizer)视频

基于本地 AI 智能体的自主售后运营 | Intel® Core™ Ultra 系列 3

在本演示中,Muse Glimmer 扮演了一个自主售后运营智能体的角色,完全运行在 Intel® Core™ Ultra 3系列平台上。Muse Glimmer 通过 llama.cpp 并借由一个 FastAPI 编排器对外提供服务,使销售团队能够完成成单流程,同时让已签署的合同、定价与客户数据全部留在设备本地,且云端成本为零。

它做了什么

当销售代表将一笔交易标记为已成交时,该智能体会自主执行整个售后交接流程——这类流程通常需要团队花费数天时间在邮件往来与表格追踪上:

  • 跨六份文档的多跳合同发现:在真正的“推理—行动—观察”(reason, act, observe)循环中进行,由模型对每份文档的理解来决定下一步该读取什么

  • 有据可依的信息抽取:将条目逐项与真实产品目录进行核对,对缺失的文档如实记录为缺口(gap),而不是凭空猜测

  • 并发的履约与激活:在一道校验屏障之后,并行生成采购订单、客户导入工单与欢迎邮件

  • 受策略约束的升级机制:当折扣超出合同链中所载明的权限阈值时,自动转交人工审批

  • 完整的审计轨迹:记录哪条条款导向了何处、哪些条款优先适用、哪些条款已被取代

一次完整运行大约执行 20,000 token 的提示、推理与结构化输出,涵盖十次模型调用与一条六份文档的合同链,全部在本地处理,敏感的合同数据与业务逻辑完全留在设备之内。

演示视频

售后运营智能体本地运行(Post Sales Operation Agent Running Locally)视频

基于 SuperClaw 的邮件效率智能体 | 双 Intel® Arc™ Pro B70

英特尔 SuperClaw 上的本地智能体 AI

Muse Glimmer 的智能体能力与英特尔更广泛的智能体架构相辅相成,这一点通过 SuperClaw 平台(https://aibuilder.intel.com/)得到了充分体现。该平台旨在展示一种本地优先、硬件加速的智能体运行时:它将高频与敏感的工作负载路由到本地英特尔硬件,同时把云端资源保留给更复杂的推理任务。在这一环境中运行 Muse Glimmer 模型,可实现智能体推理、工具调用、自适应的本地—云端路由以及多会话编排,从而交付一套兼顾隐私意识与成本效益的解决方案。

它做了什么

在本演示中,Muse Glimmer 驱动了一个自主邮件情报智能体,通过 SuperClaw 平台运行在双 Intel® Arc™ Pro B70 GPU 上。在获得数月邮件通信的访问权限后,该智能体完全在设备端识别、抽取并综合出最相关的信息,敏感的业务数据始终不离开本地网络。

当团队成员需要一份关于该项目的整合视图时,该智能体会自主梳理数月的邮件历史,交付一份全面的项目摘要,替代数小时的人工收件箱检索:

  • 项目概览:对 Project NorthStar 的高层描述,包括所采用的技术、关键目标与预算

  • 时间线:最初的项目排期、后续变更、关键里程碑,以及最新的预期日期

  • 关键风险与问题:已识别的预算隐忧、安全发现、技术挑战,以及其他可能影响项目执行的风险

  • 客户与业务影响:相关的销售管线信息、客户反馈、营收预测,以及其他业务层面的影响

  • 当前状态:基于最新的沟通与更新,对项目所处阶段给出简明评估

以上全部通过 Muse Glimmer 与 SuperClaw 在本地完成处理,敏感的业务通信与项目数据完全保留在组织内部。

演示视频

智能体效率用例:ReAct + 重规划(Agentic Productivity Use Case: ReAct + Replanning)视频

OpenVINO™ 工具套件优化:最大化英特尔硬件性能

即将通过 OpenVINO™(英特尔面向高性能 AI 推理的开源工具套件)推出的支持,将使 CPU 与 GPU 资源都能被充分利用,从而在英特尔硬件上最大化 Muse Glimmer 的吞吐并最小化延迟。OpenVINO™ 还可通过先进的投机解码(speculative decoding)技术(包括 DFlash)进一步提升 Muse Glimmer 的性能,加速 token 生成,交付智能体工作流所要求的快速、低延迟响应。Muse Glimmer 将在 OpenVINO™ 生态的关键工具中获得启用,包括:用于简化生成式 AI 流水线开发的 OpenVINO™ GenAI;通过 OpenAI 兼容端点实现可扩展、高效模型服务,并支持高效工具调用与智能体 AI 工作流的 OpenVINO™ 模型服务器(OVMS);以及与 Hugging Face 工作流无缝集成的 Optimum Intel。这些工具与优化共同为开发者提供了一条灵活而强大的路径,使其能够在英特尔硬件上本地部署 Muse Glimmer,并获得生产级智能体应用所需的性能与可靠性。OpenVINO™ 的支持预计将在下周推出,敬请关注。

与上游AI 框架的 Day 0 支持

英特尔坚定致力于通过开放、无摩擦的开发者体验来赋能整个 AI 生态。英特尔的解决方案在各主要社区框架中获得原生支持,包括 llama.cpp、vLLM、PyTorch、ExecuTorch 以及 Hugging Face Transformers,覆盖从 AI PC / 边缘与端侧执行到云端数据中心的全谱系 AI 工作负载,并横跨 Intel® Xeon® 处理器、新近发布的 Intel® Arc™ Pro B70 与 Intel® Core™ Ultra 处理器。

这一生态战略的核心,是英特尔的“上游优先”(Upstream First)承诺。英特尔积极地将性能优化、硬件加速与架构特性直接回馈到这些开源项目的上游主线中,确保开发者能够满怀信心地进行创新,因为他们知道自己的应用从 Day 0 起就能在英特尔平台上顺畅、高效地运行。

立即在英特尔硬件上开始使用 Muse Glimmer

准备好用 Meta 的 Muse Glimmer 构建属于你自己的智能体 AI 应用了吗?请从 Hugging Face 下载模型,并借助下列资源开始探索。

试用演

通过我们开箱即用的演示亲手体验 Muse Glimmer,每个演示都展示了英特尔硬件上的一种不同智能体用例:

从 vLLM、Hugging Face Transformers 与 PyTorch 开始

请查阅指南《Day 0 Muse Glimmer Support on Intel Platforms with vLLM and Hugging Face》,了解如何使用 vLLM 与 Hugging Face Transformers,在 Intel® Xeon® 服务器以及 Intel® Arc™ Pro B60/B70 GPU 上运行 Muse Glimmer。

从 OpenVINO 开始

即将推出:预转换的 OpenVINO™ IR 模型,以及入门 notebook。

总结

对于希望构建下一代本地化、私密且强大的 AI 智能体的开发者而言,英特尔硬件上的 Muse Glimmer 将 Day 0 框架支持、优化过的软件与英特尔硬件整合成了一套面向智能体 AI 开发与部署的统一系统。凭借宽松的 Apache 2.0 许可、开箱即用的强大多模态与智能体能力,以及通过上游 AI 框架(llama.cpp、vLLM、Hugging Face Transformers 与 PyTorch)和 OpenVINO™ 工具套件提供的支持,开发者可以快速而自信地从下载模型走到跑通一个可用的智能体。无论目标平台是轻薄的消费级笔记本电脑,还是专业工作站,英特尔广泛的硬件产品组合都能提供相应的性能、灵活性与工具链,让由 Muse Glimmer 驱动的智能体成为现实,同时使数据保持私密并留在设备本地。

0个评论