本文是一份调研数据报告,重点汇总截至 2026 年 8 月可获得的公开实验数据,不重复展开移动端侧微调的概念、价值和技术原理。相关术语与背景见知识条目《移动端侧微调》。
本文所说的移动端侧微调(mobile on-device fine-tuning),是端侧微调的一个子类,特指在手机、平板等移动终端上,利用设备本地数据更新模型。为了避免把不同实验条件混在一起,本文将证据分为两组:第一组是真实移动终端上的纯本地或端云协同实验,可用于判断真机可行性;第二组是边缘开发板、MCU 与服务器模拟实验,只用于判断方法是否具有迁移潜力,不能直接代表手机表现。
从公开数据看,这一方向已经越过“能否在真机上完成模型更新”的可行性验证阶段,但尚未普遍越过“能否在资源预算内稳定产生质量收益,并成为长期系统能力”的产品化阶段。因此,下面不仅记录模型规模和单步速度,也同时保留峰值内存、总时间、能耗、微调效果及证据边界。
1 数据范围与比较口径
| 证据类型 | 本文定义 | 可以支持的判断 | 不能直接支持的判断 |
|---|---|---|---|
| 真实移动终端、纯本地 | 数据、forward 和参数更新均在真实手机/平板完成;采用 BP 时,backward 也在本地完成 | 真机可执行性,以及实际内存、时间和能耗 | 少量 step 不能证明完整收敛、长期稳定或可产品化 |
| 真实移动终端、端云协同 | 本地数据参与训练,但部分计算、模型资产或中间结果依赖云端 | 端侧负担、通信成本与协同方案是否可行 | 不能等同于纯离线训练;中间表示仍需隐私评估 |
| 边缘板、MCU 或服务器模拟 | 在 Jetson、Raspberry Pi、Cortex-M、PC 或服务器上验证 | 算法、内存管理和系统优化是否值得迁移 | 不能直接外推移动系统的后台调度、温控、驱动和真机性能 |
2 真实移动终端量化结果
同一工作后续行中的空白单元格表示与该工作首行相同。
| 工作 | 方法 | 设备与运行环境 | 模型与训练配置 | 峰值内存 | 时间/能耗 | 微调效果 |
|---|---|---|---|---|---|---|
| PocketLLM, 2024 | MeZO ZO 原位扰动参数 |
OPPO Reno 6 12 GB Android/Termux |
RoBERTa-large | 约 4.0–4.8 GB | 约 83–123 s/step | 10 step 内 loss 下降 |
| OPT-1.3B | 约 6.5 GB | 约 1,800 s/step | ||||
| XPerT, MobiSys 2025 | ONNX Runtime LoRA 相似个性模型 warm-start |
OnePlus 12R Android Java 后台服务 |
Llama-3.2-1B | NR | 合成数据从零 97.8 min 15.7 kJ 90% 相似 warm-start 17.9 min 2.8 kJ |
warm-start 的 BLEU/ROUGE 与从基础模型续调相近 |
| Pixel 9 Pro Android Java 后台服务 |
Qwen2-0.5B | 合成数据从零 26.4 min 6.2 kJ 90% 相似 warm-start 4.4 min 1.0 kJ |
||||
| Pixel 7 Android Java 后台服务 |
SmolLM-360M | 合成数据从零 93.6 min 18.0 kJ 90% 相似 warm-start 26.2 min 5.1 kJ |
||||
| MobiZO, EMNLP 2025 | MP-LoRA 并行 ZO |
OnePlus 12 12 GB Hexagon NPU Qualcomm AI Engine Direct 2.28 ExecuTorch 0.6 |
TinyLlama-1.1B FP16 effective batch 16 seq 128 |
手机值 NR | 手机:5.76 s/step Jetson Orin Nano:2.00 s/step |
NR |
| MeBP, EMNLP Industry 2025 | 精确 LoRA BP rank 16 |
iPhone 15 Pro Max 8 GB A17 Pro 自定义移动运行时 |
Qwen2.5-0.5B | 320.17 MB 工作集 | 3.85 s/gradient step | NR |
| Qwen2.5-1.5B | 460.24 MB 工作集 | 9.09 s/gradient step | ||||
| Qwen2.5-3B | 661.78 MB 工作集 | 17.96 s/gradient step | ||||
| Gemma 3-1B | 569.00 MB 工作集 | 9.48 s/gradient step | ||||
| Gemma 3-4B | 1,029.49 MB 工作集 | 28.58 s/gradient step | ||||
| MeSP, ACL Industry 2026 | 手写结构化精确 BP LoRA rank 8 |
iPhone 17 Pro 8 GB A19 Pro MLX |
Qwen2.5-0.5B INT4 |
136.2 MB 工作集 | 0.86 s/step | NR |
| Qwen2.5-1.5B INT4 |
262.6 MB 工作集 | 2.17 s/step | ||||
| Qwen2.5-3B INT4 |
368.4 MB 工作集 | 4.09 s/step | ||||
| MobileFineTuner v2, 2026 | 原生 C++ LoRA rank 8 batch 8 seq 128 |
华为 P50 Pro 华为 nova 9 Pro |
GPT-2 可执行性实验 |
NR | NR | NR |
| 完整指标主要在 iQOO 15 | Qwen2.5-0.5B | 约 2,887 MB RSS | MMLU 总时间:25.94 h 能耗:75.88 kJ |
MMLU accuracy 44.25% → 47.35% |
||
| Gemma 3-1B | 约 8,209–8,942 MB RSS | MMLU 总时间:142.76 h 能耗:437.98 kJ |
MMLU accuracy 24.60% → 27.51% |
|||
| FBLayout, MobiSys 2026 | 移动 GPU 精确 BP LLM LoRA 到 QKV/MLP seq 512 |
Snapdragon 8 Elite / Adreno 830 Snapdragon 8 Gen 1 / Adreno 730 Dimensity 9400+ / Mali G925 三台手机 |
Llama-1B | 绝对值 NR | decoder LLM 汇总范围 比 MNN 快 3.9–4.1× 比 TFLite 快 4.3–4.9× 比 TVM 快 5.4–5.7× 5 轮能耗低 3.5–6.3× |
NR |
| Qwen-1.5B | ||||||
| Gemma-2B |
- NR(Not Reported):论文未报告该项,不表示数值为零,也不表示实验没有开销。
- 工作集(working set):训练运行时主动分配并统计的内存。MeBP/MeSP 的该数值可能不包含 memory-mapped 权重页、共享库和系统缓存,因此不能直接与 RSS 横向比较。
- RSS(Resident Set Size):进程当前驻留在物理内存中的页面总量,通常包含代码、堆栈、堆、共享页和文件映射页;具体范围仍取决于操作系统和采样工具。
- step / gradient step:
step是论文对一次训练循环的泛称;gradient step通常指一次优化器参数更新,但作者口径可能不同。梯度累积时,多个 micro-step 才产生一次更新;ZO 的一次更新又可能包含多次 forward。相关方法解释见知识条目《移动端侧微调》。 - batch / effective batch / seq:
batch是一次处理的样本数;effective batch还计入梯度累积后的等效样本数;seq是输入序列的 token 长度,通常越长越耗时、越占内存。 - BP / ZO / LoRA / rank:BP 是用反向传播计算梯度;ZO 是只通过多次前向计算估计更新方向;LoRA 只训练插入基座模型的低秩矩阵;
rank是其低秩维度,通常越大,可训练参数越多。 - FP16 / INT4:分别表示 16 位浮点和 4 位整数表示。低比特通常减少权重存储与带宽,但不代表训练总内存按相同比例下降。
- BLEU / ROUGE / MMLU:BLEU 和 ROUGE 衡量生成文本与参考文本的重合程度;MMLU 是多学科选择题基准,表中报告的是 accuracy。能耗单位
kJ为千焦,1 Wh = 3.6 kJ。
证据边界:PocketLLM 的手机 benchmark 只跑 10 step,不能视为完整收敛或可后台运行;XPerT 依赖云端预制个性模型和一次下载,不是纯离线起步;MobiZO 的 20k-step 质量实验与手机系统实验不是同一平台,手机未给总收敛时长、能耗和最终质量;MeBP 的效用对照主要在服务器,且当前实现针对短序列和 iOS;MeSP 的 100k-step 收敛实验在 M4 而非手机;MobileFineTuner v2 是预印本,仍需独立复现;FBLayout 只给相对吞吐、能耗和 cache 结果,没有绝对 s/step、RSS 或完整收敛时间。
3 边缘板、MCU 与服务器模拟结果
为便于与前一节对照,本节沿用相同字段;同一工作后续行中的空白单元格也表示与首行相同。这里的“设备与运行环境”不是手机,所有结果均应按旁证理解。
| 工作 | 方法 | 设备与运行环境 | 模型与训练配置 | 峰值内存 | 时间/能耗 | 微调效果 |
|---|---|---|---|---|---|---|
| TinyTL, NeurIPS 2020 | 冻结主干 只训练 bias 与 lite residual |
MCU 路线 小型视觉模型 |
多个移动视觉模型 | 相比全量更新最多节省 6.5× lite residual 只增加约 3.8% 内存 |
NR | 相比只训练最后一层 最高提升 33.8 个百分点 |
| Tiny Training Engine, NeurIPS 2022 | 量化感知缩放 稀疏更新 编译期自动微分 |
MCU 256 KB SRAM 1 MB Flash |
小型 CNN | 可在 256 KB SRAM 内训练 论文称低于 PyTorch/TF 的 1/1000 |
NR | NR |
| POET, ICML 2022 | MILP 联合优化 rematerialization 与 paging |
Cortex-M 约束模拟 | ResNet-18 BERT |
在给定内存预算下求解 schedule | 在给定时间预算下 优化能耗 |
NR |
| PockEngine, MICRO 2023 | 稀疏 backward compile-first |
Jetson AGX Orin | Llama2-7B seq 512 batch 1 Alpaca 52K 3 epochs |
sparse:31.2 GB LoRA:30.9 GB full:43.1 GB |
sparse:0.9 s/iter LoRA:7.3 s/iter full:1.8 s/iter |
sparse:AlpacaEval 43.1% MT-Bench 5.7 LoRA:43.1% / 5.1 full:43.7% / 6.1 |
| MCU / Jetson | MCUNet 0.6M BERT 125M,batch 16 |
MCUNet:3.6 MB → 173 KB BERT:5.7 GB → 2.3 GB |
NR | NR | ||
| MobiLLM, 2025 | additive side network 端云协同训练 |
Jetson Xavier NX 8 GB 可用约 4.6 GB 华为 MateBook + A100 Wi-Fi 5 |
OPT-1.3B batch 16 seq 256 |
MobiLLM:4.487 GB LoRA:14.497 GB full FT:20.895 GB |
达到目标精度相对 LoRA Xavier 快 1.8× 笔记本快 2.3× |
GLUE 平均分 MobiLLM:81.0 LoRA:82.5 full FT:83.6 |
| PAE MobiLLM, 2025 | activation cache token selector additive side network |
Jetson Xavier NX / MateBook + A100 | OPT-1.3B MRPC |
NR | device compute:124.5 → 9.5 PFLOPs 通信:1,856.8 → 0.55 GB 单 batch:26.72 → 2.86 s |
NR |
| LCSB, 2026 | selective backward 只对选中层反传 |
A100 模拟 4-bit mobile-like 环境 |
Qwen 0.5B / 1.5B / 3B 50% 层 backward |
NR | 分别加速约 1.12× / 1.35× / 1.40× 自适应配置最高 4.55× |
loss 差约 0.85%–1.14% |
| LARS, 2026 | activation-rank subspace | Raspberry Pi 消费级 CPU/GPU |
NR | 相比 LoRA 平均节省 GPU 33.54% CPU 51.95% |
NR | NR |
PockEngine 表里看似反常的一点是 LoRA(30.9 GB)与 sparse(31.2 GB)几乎同内存,但 sparse 更快、质量更好。这说明“adapter 参数量”不是训练成本的全部:反向图范围、kernel、activation 生命周期和运行时调度也会决定实际开销。不过,31 GB 的边缘板结果不能作为手机可训练 7B 模型的证据;同理,MobiLLM、LCSB 和 LARS 的数据也只能用于选择值得迁移到移动终端验证的技术方向。