☰
ollama v0.40.0发布:Apple Silicon 默认启用 MLX,决策模型、嵌入能力与 OpenAI 工具消息全面演进
2026/10/9 12:20:35 网站建设 项目流程

2026 年 10 月 7 日,Ollama 发布 v0.40.0 版本。本次更新的核心方向非常明确:进一步强化 Apple Silicon 设备上的 MLX 运行时体验,同时完善决策模型支持、嵌入能力、多模态嵌入、OpenAI 兼容接口中的工具消息处理,以及模型拉取、路由和底层运行时兼容性等多个方面。

从更新内容来看,v0.40.0 不只是一次常规模型列表扩展,而是围绕本地模型运行效率、Apple Silicon 适配、复杂工具调用消息处理、图像结果保留以及嵌入接口能力进行的一次集中升级。


一、Apple Silicon 默认使用 MLX:本次版本最核心的变化

v0.40.0 最重要的更新,是在 Apple Silicon 设备上,支持 MLX 运行时的模型架构将自动通过 MLX 运行。

也就是说,在 Apple Silicon 设备环境中,只要某个模型架构已经得到 MLX 运行时支持,Ollama 会默认选择 MLX 来运行该模型。

这一变化直接体现在版本说明中的核心描述:

在 Apple Silicon 设备上,受到 MLX 运行时支持的模型架构将自动在 MLX 上运行。

对于 Apple Silicon 用户而言,这意味着模型运行时的选择不再只是用户需要额外关注的配置问题。Ollama 在模型架构和运行时能力支持的基础上,自动将符合条件的模型交给 MLX 执行。

此次更新围绕 MLX 进行了多项相关工作,包括:

  • MLX 的 System one 支持
  • MLX 决策模型改进
  • 对发布方分词器语义进行匹配
  • 缓解 GPU 空闲后出现的高延迟问题
  • 降低模型查找和 MLX 决策请求的开销
  • MLX 版本升级
  • 修复与近期 MLX 更新相关的补丁问题
  • MLX 对嵌入能力的支持

从这些内容可以看出,MLX 在 v0.40.0 中并非只获得默认启用这一项变化,而是涉及系统支持、决策模型、分词器语义、请求性能、GPU 空闲后的延迟表现、版本兼容性和嵌入能力等多个层面。

其中,“缓解 GPU 空闲后高延迟”尤其值得注意。模型在 GPU 一段时间未工作后再次被请求时,延迟表现会直接影响交互体验。该项提交明确针对这一情况进行了缓解。

与此同时,“降低模型查找和 MLX 决策请求开销”则指向了请求处理流程中的效率优化。除了模型本身的执行速度外,模型定位、运行时选择和决策请求的处理成本,同样会影响整体响应体验。


二、模型运行命令:qwen3.8 的拉取与运行方式

v0.40.0 的版本说明中给出了 qwen3.8 的使用示例。

拉取模型:

ollama pull qwen3.8

运行模型:

ollama run qwen3.8

这两条命令分别对应模型的下载与启动运行流程。

首先,通过ollama pull qwen3.8获取模型;随后使用ollama run qwen3.8启动模型并进入交互运行。

在本次 Apple Silicon 默认 MLX 的更新背景下,如果 qwen3.8 的模型架构受到 MLX 运行时支持,那么在 Apple Silicon 设备上,它将自动通过 MLX 运行。

版本说明没有要求用户增加额外的 MLX 启动参数,也没有展示手动切换运行时的命令,而是强调符合条件的模型架构会自动在 MLX 上执行。


三、模型范围扩展:新增多个可用模型

除 qwen3.8 外,本次版本说明还列出了更多模型:

  • gemma4
  • qwen3.6
  • qwen3.5

这意味着 v0.40.0 的模型可用范围中,除了 qwen3.8 之外,还包括 gemma4、qwen3.6 和 qwen3.5。

版本说明使用的是“Additional models include”的表达,即额外可用模型包括以上内容。因此,qwen3.8 与这些新增模型共同构成了本次说明中被明确提及的模型范围。

从版本内容来看,模型支持与 MLX 默认运行并不是彼此独立的两部分。Apple Silicon 上的 MLX 自动运行机制,为受支持模型架构提供了新的默认执行路径;而模型列表扩展,则为用户带来更多可拉取、可运行的模型选择。


四、决策模型正式进入 MLX 支持范围

v0.40.0 进一步明确:决策模型现在也已可在 MLX 上使用。

版本说明中列出的决策模型包括:

  • Nimble
  • tev1
  • clef
  • clef-flash

这项更新的重要之处在于,MLX 的能力范围不再仅限于普通模型架构支持,也覆盖到了决策模型。

同时,提交记录中还出现了以下与此相关的内容:

  • 文档链接到可用的决策模型
  • 文档记录决策模型的图像输入能力
  • MLX 决策模型改进
  • 降低 MLX 决策请求开销

这些变化共同构成了决策模型在 v0.40.0 中的完整更新脉络。

一方面,决策模型被明确纳入 MLX 支持范围;另一方面,文档开始指向可用的决策模型,并记录决策模型支持图像输入这一能力。同时,底层还对 MLX 决策模型进行改进,并减少相关请求的处理开销。

因此,本次决策模型更新不仅仅是“可以在 MLX 上运行”,还包括可用模型文档入口、图像输入文档说明、运行改进和请求开销优化等多个组成部分。


五、MLX 支持嵌入能力

v0.40.0 的另一个重要变化是:MLX 现在支持嵌入。

版本说明中明确写到,MLX 已经具备嵌入支持。

此外,提交记录中还包括“模型:添加多模态嵌入”的内容。

这意味着,本次嵌入相关更新包含两个层面:

  • MLX 支持嵌入
  • 模型支持多模态嵌入

前者是 MLX 运行时层面的能力扩展,后者则是模型能力层面的更新。

嵌入能力是本次版本更新中单独被强调的内容。随着 MLX 支持嵌入,Apple Silicon 设备上的模型运行时能力覆盖范围进一步扩大;而多模态嵌入的加入,则表明嵌入相关能力不局限于单一输入类型。

在接口路由层面,本次还修复了 embed 接口中 413 与 400 的路由问题。这一修复直接关联嵌入请求处理,说明 v0.40.0 不仅增加了 MLX 嵌入和多模态嵌入能力,也同步处理了 embed 路由中的状态码问题。


六、OpenAI 兼容接口:工具消息内容处理全面调整

v0.40.0 中,OpenAI 相关的改动数量较多,重点集中在工具消息、工具结果、空结果和图像结果的内容组织方式上。

本次涉及的 OpenAI 相关提交包括:

  • 保持工具消息内容部分位于同一条消息中
  • 将空工具结果保留为一个空内容数组
  • 合并工具结果部分时保留图像位置
  • 对包含图像的工具结果进行拆分,而不是加入图像标记
  • 合并包含图像的工具结果处理

这些更新共同反映出,v0.40.0 对工具调用结果的结构化内容处理进行了细化。

首先,“保持工具消息内容部分位于同一条消息中”,说明工具消息中的内容部分不再被拆散到不同消息中,而是维持在单条消息结构内。

其次,对于空的工具结果,更新要求以空内容数组的形式保留。这意味着,即使工具执行结果为空,也不再以其他形式替代,而是明确保留为空数组结构。

再次,工具结果中涉及图像时,图像位置需要在合并内容部分时得到保留。图像不仅是附加信息,也具有在消息内容中的相对位置。此次改动明确处理了图像位置在合并过程中的保留问题。

此外,当工具结果中包含图像时,系统不再通过添加图像标记来处理,而是对这些结果进行拆分。版本说明中的描述是:拆分带有图像的工具结果,而不是增加图像标记。

这些变化可以归纳为一个清晰方向:工具消息与工具结果的内容结构更加严格,空结果、图像结果、图像位置以及内容部分的归属关系都得到更精细的处理。

对于使用 OpenAI 兼容接口、工具调用以及带图像工具结果的场景而言,这些改动是 v0.40.0 中不可忽略的一部分。


七、分词器语义匹配:MLX 进一步贴近发布方行为

本次提交记录中还包括“MLX:匹配发布方分词器语义”。

这一项更新的重点在于分词器语义匹配。

模型在运行过程中,分词器负责将输入内容转化为模型可处理的形式。v0.40.0 对 MLX 进行了分词器语义层面的匹配工作,使其行为与发布方分词器语义保持一致。

该更新与 Apple Silicon 默认使用 MLX 的整体方向相互关联。随着更多模型架构在 Apple Silicon 上自动选择 MLX 运行,分词器语义的一致性也成为运行时适配工作中的重要环节。


八、模型拉取规则更新:允许候选版本匹配最低版本要求

在模型拉取相关部分,v0.40.0 包含一项更新:

  • 允许候选版本拉取匹配最低版本要求

提交说明中使用的是 RCs,即候选版本。该项变化针对的是模型拉取时的最低版本匹配规则。

也就是说,在拉取流程中,候选版本可以匹配相应的最低版本要求。

这一改动属于 pull 流程的规则调整,与模型下载行为直接相关。


九、底层兼容与版本更新:llama-server、llama.cpp、MLX

除了用户可直接感知到的 MLX 默认运行、模型支持和工具消息处理外,v0.40.0 还包含多项底层维护和兼容性工作。

相关提交包括:

  • llama-server:准备移除兼容性补丁
  • llama.cpp:版本更新
  • MLX:版本升级
  • MLX:修复与近期 MLX 更新相关的补丁问题
  • 多次合并上游主分支到发布分支
  • 合并 OpenAI 工具数组内容相关变更
  • 测试:拆分 create 集成测试

其中,llama-server 的变化是为移除兼容性补丁做准备。该内容显示,兼容性补丁相关工作仍在持续调整。

llama.cpp 则进行了版本更新,MLX 也进行了版本升级。与此同时,针对近期 MLX 更新带来的变化,v0.40.0 修复了相关补丁问题。

测试方面,本次将 create 集成测试进行了拆分。这属于测试组织结构上的调整。

此外,发布分支在多个日期进行了与上游主分支的合并,说明本次发布过程中持续同步了主线更新内容。


十、完整提交时间线梳理

为了完整还原 v0.40.0 的更新构成,以下按照时间顺序整理本次版本中列出的提交内容。

2026 年 9 月 25 日

  • llama-server:准备移除兼容性补丁

2026 年 9 月 29 日

  • 将上游主分支合并到发布分支
  • 再次将上游主分支合并到发布分支

2026 年 9 月 30 日

  • 将上游主分支合并到发布分支

2026 年 10 月 1 日

  • OpenAI:保持工具消息内容部分位于同一条消息中

2026 年 10 月 2 日

  • OpenAI:将空工具结果保留为一个空内容数组
  • 将上游主分支合并到发布分支
  • OpenAI:合并工具结果部分时保留图像位置

2026 年 10 月 3 日

  • 文档:链接到可用的决策模型
  • 文档:记录决策模型的图像输入
  • OpenAI:拆分带图像的工具结果,不再增加图像标记

2026 年 10 月 4 日

  • MLX:System one 支持
  • MLX:决策模型改进
  • MLX:匹配发布方分词器语义
  • 将上游主分支合并到发布分支

2026 年 10 月 5 日

  • pull:允许候选版本拉取匹配最低版本要求

2026 年 10 月 6 日

  • 合并 OpenAI 工具数组内容相关变更
  • 测试:拆分 create 集成测试
  • MLX:缓解 GPU 空闲后的高延迟
  • 降低模型查找与 MLX 决策请求开销
  • 将上游主分支合并到发布分支
  • llama.cpp:版本更新
  • MLX:版本升级
  • MLX:修复近期 MLX 更新相关的补丁问题
  • 模型:添加多模态嵌入

2026 年 10 月 7 日

  • routes:修复 embed 接口中 413 与 400 的路由问题

十一、v0.40.0 更新重点总结

Ollama v0.40.0 的更新重点,可以从以下几个方向进行归纳。

第一,Apple Silicon 上的 MLX 成为默认执行路径。

在 Apple Silicon 设备上,受到 MLX 运行时支持的模型架构会自动通过 MLX 运行。这是本版本最核心的变化。

第二,模型与决策模型范围进一步扩展。

本次明确提到 qwen3.8,并列出 gemma4、qwen3.6、qwen3.5 等额外模型。与此同时,Nimble、tev1、clef、clef-flash 等决策模型现在也可在 MLX 上使用。

第三,MLX 能力覆盖面扩大。

MLX 获得嵌入支持,并完成 System one 支持、决策模型改进、分词器语义匹配、GPU 空闲后延迟缓解、请求开销降低、版本升级和补丁修复等更新。

第四,嵌入能力得到同步增强。

除了 MLX 支持嵌入外,模型侧还加入多模态嵌入,并修复 embed 接口中 413 与 400 的路由问题。

第五,OpenAI 工具消息与图像结果处理更加精细。

工具消息内容保持在同一条消息中;空工具结果使用空内容数组保留;图像位置在内容合并时得到保留;带图像的工具结果采用拆分方式处理,而不是插入图像标记。

第六,模型拉取、测试、底层组件持续维护。

候选版本可以匹配最低版本要求;create 集成测试被拆分;llama-server 兼容性补丁进入准备移除阶段;llama.cpp 与 MLX 均完成版本更新。


结语

代码地址:github.com/ollama/ollama

Ollama v0.40.0 是一次以 MLX 为中心的版本更新。

在 Apple Silicon 上,支持 MLX 的模型架构将自动运行在 MLX 之上;决策模型正式进入 MLX 支持范围;MLX 新增嵌入支持;模型侧加入多模态嵌入;OpenAI 工具消息、空工具结果和图像结果处理得到进一步完善;同时,GPU 空闲后的延迟、模型查找开销、决策请求开销、embed 路由状态码、分词器语义和底层版本兼容问题也都得到处理。

对于使用 Apple Silicon 设备运行 Ollama 的用户而言,v0.40.0 的重点在于 MLX 自动运行机制及其配套优化。对于使用决策模型、嵌入能力、图像工具结果和 OpenAI 兼容接口的用户而言,本次版本同样带来了覆盖模型、接口、路由和消息内容结构的多项变化。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询