历史 v0.6.2 范围

macMLX v0.6.2

作为历史记录,2026-07-11 发布版完成了 v0.6 智能体后端能力波次,并新增 Track G 模型支持与逐模型聊天模板覆盖;后续 v0.7.0 硅指标工作不属于此记录。

兼容性与升级说明

兼容性
模型与请求边界保持明确:批处理受资格门控,结构化输出会拒绝不支持的 Schema 与组合,理论模型等级不代表已演示真实生成。
升级
如使用这一历史版本,请查看 v0.6.2 标签版更新日志与模型支持指南。v0.7.0 的硅指标活动面板、基准归因与 OCR 识别不属于 v0.6.2。

已交付

已发布0.1.0

Apple 芯片 macOS 安装

macMLX 支持运行 macOS 14 或更高版本的 Apple 芯片 Mac。

请使用项目当前安装与 Gatekeeper 指南;不要仅为打开应用而关闭系统级安全保护。

核验

已发布0.1.0

Swift 进程内推理

默认引擎在 Swift 进程内加载并运行 MLX 模型。

模型加载、生成、缓存与服务通过 MacMLXCore 使用 Apple MLX;默认推理路径不需要 Python 运行时。

核验

已发布0.1.0

Apple 芯片统一内存

MLX 数组使用 Mac 的 CPU/GPU 共享内存系统。

统一内存减少 CPU 编排与集成 GPU 计算之间的显式传输,但模型权重、激活值和 KV 缓存仍会占用有限的物理内存。

核验

已发布0.1.0

共享代码,进程内各自运行

应用与 CLI 都导入 MacMLXCore,推理和服务由核心负责。

两个产品共享实现与行为;当应用和 CLI 分别运行在不同进程时,它们不会共享同一个内存中引擎实例。

核验

已发布0.1.0

默认路径无需 Python

已发布的默认引擎为 Swift 原生,不需要 Python 运行时。

可选兼容引擎可能使用子进程与其他运行时,因此这并不表示项目任何地方都没有 Python。

核验

已发布0.5.3

OpenAI 端点兼容

聊天、传统补全、模型列表与嵌入使用兼容的请求和响应结构。

兼容范围按端点界定。/x/models 下的模型加载与卸载是 macMLX 扩展,不属于 OpenAI 兼容的模型管理。

核验

已发布0.5.3

Anthropic Messages 兼容

v0.5.3 提供 POST /v1/messages,并支持流式响应。

这里只兼容 Messages API,不代表兼容完整 Anthropic API。

核验

已发布0.3.7

部分 Ollama 端点

macMLX 支持 /api/version、/api/tags、/api/show、/api/chat 与 /api/generate。

该兼容层自 v0.3.7 起提供;它只覆盖选定端点,不是完整 Ollama API 的无差别替代。

核验

已发布0.5.0

MCP 服务端

CLI 可向 MCP 客户端提供本地推理能力。

MCP 服务端在 v0.5.0 发布,与聊天侧调用外部工具的路由功能不同。

核验

已发布0.5.3

MCP 客户端池

v0.5.3 包含受管理的 MCP 客户端连接。

客户端池负责管理外部 MCP 进程与连接;聊天侧集成工具路由是另一个在 v0.6.0 发布的能力。

核验

已发布0.6.0

聊天集成工具路由

v0.6.0 为 OpenAI、Anthropic 与 GUI MCP 循环交付多轮工具路由。

各协议的验证明确约束工具调用历史;该路由与 MCP 服务端及客户端池基础设施不同。

核验

已发布0.5.3

本地嵌入

POST /v1/embeddings 已在 v0.5.3 发布。

系统可以检测编码器模型家族,但若使用不合适的聊天模型,仍可能生成缺乏语义保证的向量。

核验

已发布0.5.3

双编码器重排 MVP

POST /v1/rerank 对独立嵌入的文本计算余弦相似度。

这一已发布 MVP 不是交叉编码器重排器。

核验

已发布0.5.0

精确前缀 RAM 与 SSD 缓存

内存热层与内容寻址 SSD 冷层支持提升和降级。

v0.5.0 发布的缓存复用完整精确前缀,不包含已发布的块共享或分页 KV 分配。

核验

已发布0.6.0

Trie 最长前缀复用

v0.6.0 可复用最长兼容缓存词元前缀。

多轮提示可裁剪到最长公共前缀,只增量预填充新增后缀,同时用量统计仍按完整提示计算。

核验

已发布0.5.0

有界模型池

预算、LRU 淘汰、固定、冷切换、空闲 TTL 与探针共同约束多模型使用。

模型池在 v0.5.0 发布并于 v0.5.3 加固;它不是统一自适应控制器。

核验

已发布0.5.0

受支持的 LoRA 适配器

原生引擎可应用受支持的 LoRA 适配器。

适配器兼容性取决于基础架构与权重,不宣称通用 LoRA 兼容。

核验

已发布0.5.3

检测 14 个 VLM 家族

模型库可检测 14 个视觉语言 model_type 家族。

这是有证据支持的家族数量,不保证每个检查点或处理器变体都能加载。

核验

已发布0.5.3

DeepSeek V3.2 Swift 覆盖层

v0.5.3 包含 DeepSeek V3.2 架构的纯 Swift 组件对齐实现。

真实检查点冒烟测试仍待完成,且缺少 FP8 反量化,因此不构成端到端或通用 MoE 声明。

核验

已发布0.6.0

资格门控的连续批处理

v0.6.0 仅在真实并发下批处理符合条件的稠密文本请求,并自动回退到串行路径。

标签版 4 客户端基准测得 2.5–3.2× 聚合吞吐量;VLM、推测解码、Ollama、Anthropic 与嵌入仍保持串行。

核验

已发布0.6.0

固定预填充准入节流

固定 prefillBatchSize 限制每个调度步骤接纳的行数。

已发布的节流采用固定配置,并非规划中的自适应内存控制器。

核验

已发布0.6.0

结构化输出

v0.6.0 支持 response_format 的 json_object 与明确界定的 JSON Schema 子集。

不支持的 Schema 关键字返回 400;VLM 与结构化输出、工具与结构化输出都是不支持的组合,会被明确拒绝而非静默降级。

核验

已发布0.6.0

推测解码

v0.6.0 通过 API 与 GUI 交付经典草稿模型路径。

接受率遥测用于呈现草稿效率;若目标使用不可裁剪的混合或线性注意力缓存,系统会检测并回退到标准解码。

核验

已发布0.6.0

API 兼容功能包

v0.6.0 新增 logit_bias、logprobs 与 top_logprobs、XTC、逐请求 LoRA 适配器和 tools。

明确的兼容矩阵约束参数组合,不支持的配对返回 400,而不会静默降级。

核验

已发布0.6.0

KV 缓存量化

v0.6.0 为兼容请求开放 kv_bits、kv_group_size 与 quantized_kv_start。

这些参数改变 KV 缓存精度,而非模型权重精度;非正数 kv_bits 会禁用该功能,兼容矩阵会拒绝不支持的模型或请求组合。

核验

已发布0.6.0

Hugging Face 缓存发现

v0.6.0 可发现配置的 Hugging Face 缓存根目录中的模型,无需重复下载权重。

发现仅确认本地候选项,并不保证通用加载;架构、分词器、处理器与检查点兼容性仍然适用。

核验

已发布0.6.2

逐模型聊天模板覆盖

v0.6.2 按用户文件、内置 model_type、检查点模板的顺序解析模板。

内置覆盖具备标准路径等价性证据,但模板支持并非通用;检查点特定分支与 swift-jinja 不支持的语法仍可能构成边界。

核验

已发布0.6.2

Track G 已测试模型

v0.6.2 新增四个通过检查点实测的原生模型家族。

真实检查点生成实测:Seed-OSS-36B 4-bit 为 18.2 tok/s;Hunyuan V1 Dense 1.8B 4-bit 为 80.3 tok/s;Cohere Command R7B 7B 4-bit 为 21.7 tok/s;MiniCPM3-4B 4-bit 为 18.7 tok/s。结果仅适用于对应检查点,不构成整个家族的性能保证。

核验

理论支持0.6.2

InternLM3 理论支持

v0.6.2 交付通过等价性验证的 InternLM3 代码,支持等级为理论级。

真实生成尚未得到演示。公开检查点提供 tokenizer.model,但没有 tokenizer.json,而 Swift 分词器栈需要 tokenizer.json;在该加载路径边界改变前,支持仍为理论级。

核验

已发布0.1.0

temperature 与 top-p

temperature 与核采样 top-p 是已发布参数。

它们是当前已开放的核心采样控制。

核验

当前限制

已发布0.6.0

资格门控的连续批处理

v0.6.0 仅在真实并发下批处理符合条件的稠密文本请求,并自动回退到串行路径。

标签版 4 客户端基准测得 2.5–3.2× 聚合吞吐量;VLM、推测解码、Ollama、Anthropic 与嵌入仍保持串行。

核验

已发布0.6.0

结构化输出

v0.6.0 支持 response_format 的 json_object 与明确界定的 JSON Schema 子集。

不支持的 Schema 关键字返回 400;VLM 与结构化输出、工具与结构化输出都是不支持的组合,会被明确拒绝而非静默降级。

核验

理论支持0.6.2

InternLM3 理论支持

v0.6.2 交付通过等价性验证的 InternLM3 代码,支持等级为理论级。

真实生成尚未得到演示。公开检查点提供 tokenizer.model,但没有 tokenizer.json,而 Swift 分词器栈需要 tokenizer.json;在该加载路径边界改变前,支持仍为理论级。

核验

已发布0.5.3

DeepSeek V3.2 Swift 覆盖层

v0.5.3 包含 DeepSeek V3.2 架构的纯 Swift 组件对齐实现。

真实检查点冒烟测试仍待完成,且缺少 FP8 反量化,因此不构成端到端或通用 MoE 声明。

核验

规划中

规划中future

分页 KV、块共享与 CoW

分页分配、共享块与写时复制分支处于规划阶段。

这些缓存虚拟化能力均未发布;已交付的缓存仅复用完整精确前缀。

核验

规划中future

统一自适应内存守卫

跨缓存、模型池与并发的反馈控制器处于规划阶段。

已发布的内存探针和模型池上限是独立机制,不能称为该守卫。

核验

规划中future

扩展采样控制

top-k、min-p、presence、frequency 与 repetition 惩罚项,以及逐请求 seed 处于规划阶段。

DeepSeek 专家路由 top-k 是架构内部操作,与用户采样 top-k 无关。

核验

官方来源

  1. macMLX v0.6.2 · github.com
  2. macMLX v0.6.2 · github.com
  3. macMLX v0.6.2 · github.com