Chapter 09 / 16
Capture Surfaces
真实世界入口包括会议、语音、手写、图片、视频、Memova Pen 与合作硬件。
Memova Pen:个人笔迹识别技术调研
主题:用大模型 + OCR/HTR + 个人书写轨迹预训练/适配,是否能显著提升手写识别准确率
结论
可以。技术上已经有明确研究方向支持:个人笔迹适配(writer adaptation / personalized handwriting recognition)确实能提高识别准确率。
但更准确的产品化路线不是“给每个人重新预训练一个大模型”,而是:
先训练一个通用 handwriting foundation model,再为每个用户建立轻量 writer profile / writer embedding / prompt adapter。
对 Memova Pen 来说,这可以成为核心壁垒:
越写越懂你。
关键概念
手写识别主要分两类:
1. Offline HTR / OCR
只看最终图像,例如扫描纸面、拍照、截图。
优点:
- 硬件要求低
- 可以兼容普通纸面图像
缺点:
- 丢失书写过程
- 对潦草字、连笔、个人风格更难
- 只能从最终形状推断文字
2. Online Handwriting Recognition
不仅看最终图像,还捕捉书写过程,例如:
- x/y 坐标轨迹
- stroke 顺序
- pen-up / pen-down
- 速度变化
- 压力
- 倾角
- IMU 运动信息
优点:
- 比单纯 OCR 多很多信号
- 更适合个人笔迹学习
- 对连笔、缩写、潦草字更有优势
对智能笔来说,如果能拿到笔尖轨迹,理论上会明显优于单纯拍照 OCR。
相关论文
1. MetaHTR: Towards Writer-Adaptive Handwritten Text Recognition, CVPR 2021
链接: https://openaccess.thecvf.com/content/CVPR2021/html/Bhunia_MetaHTR_Towards_Writer-Adaptive_Handwritten_Text_Recognition_CVPR_2021_paper.html
核心思想:
- 不假设训练集已经覆盖所有笔迹风格
- 面对新用户时,用少量该用户样本做适配
- 通过 meta-learning,让模型在推理时快速适应新 writer
关键结果:
- 观察很少的新 writer 数据后,平均可获得 5–7% performance gain
对 Memova Pen 的启发:
- 用户初次使用时写一小段 calibration sample,就可能让识别率明显提升
- 适合做成“写一页,让 Memova 学会你的字”的 onboarding
2. Writer adaptation for offline text recognition: An exploration of neural network-based methods, 2023
链接: https://arxiv.org/abs/2307.15071
核心思想:
- 探索 handwritten text recognition 中的 writer adaptation
- 用少量新用户样本,例如约 16 个 examples,进行适配
- 比较 ResNet + LSTM / Transformer decoder 等架构
结论:
- writer adaptation 有效果,但不同模型收益不同
- MetaHTR 类方法能提升 WER,但大模型上计算和内存成本较高
对 Memova Pen 的启发:
- 不建议每个用户完整 fine-tune 大模型
- 应该用轻量 adapter / prompt / embedding 做个性化
3. MetaWriter: Personalized Handwritten Text Recognition Using Meta-Learned Prompt Tuning, 2025
链接: https://arxiv.org/html/2505.20513v1
核心思想:
- 将个性化识别建模为 prompt tuning
- 只更新少量参数,小于 1%
- 使用自监督 image reconstruction loss,让模型可以用未标注样本进行 test-time adaptation
- 比传统 full fine-tuning 更适合资源受限设备
对 Memova Pen 的启发:
这是非常接近产品化的路线:
通用模型冻结,每个用户只有一个小型 writer prompt / writer profile。
好处:
- 成本低
- 可本地运行
- 可持续学习
- 不需要用户大量标注
4. A Transformer Based Handwriting Recognition System Jointly Using Online and Offline Features, 2025
链接: https://arxiv.org/abs/2506.20255
核心思想:
- 同时使用 offline image 和 online stroke data
- 图像提供 glyph/视觉结构
- 轨迹提供时序、笔顺、动态信息
- 早期融合两种模态,提升 writer-independent recognition
对 Memova Pen 的启发:
最优架构不应该只做 OCR,也不应该只用轨迹。
更强路线是:
轨迹 + 渲染图像 + 上下文语言模型 三者融合。
5. Online handwriting trajectory reconstruction from kinematic sensors using temporal convolutional network, 2023
链接: https://link.springer.com/article/10.1007/s10032-023-00430-1
核心思想:
- 研究如何从笔内传感器信号重建笔尖轨迹
- 使用 Temporal Convolutional Network
- 适用于“在任何表面书写”的 sensor pen
对 Memova Pen 的启发:
如果未来要做“任何纸都能写”的版本,需要解决:
- 从 IMU/摄像头/传感器恢复轨迹
- 轨迹漂移校正
- 采样率对齐
- 与 ground truth 轨迹对齐
这部分是纯硬件智能笔的核心难点。
6. Benchmarking Large Language Models for Handwritten Text Recognition, 2025
链接: https://arxiv.org/abs/2503.15195
核心思想:
- 测试多模态大模型在 handwritten text recognition 上的能力
- 现代手写体上效果不错
- proprietary models 在 zero-shot setting 下表现强
- 但 LLM 自主纠错能力有限,不能完全依赖它做识别
对 Memova Pen 的启发:
大模型适合作为后处理和上下文纠错层,而不是唯一识别层。
推荐技术架构
Layer 1:数据采集
输入包括:
- 笔尖轨迹 x/y
- pen-up / pen-down
- 时间戳
- 速度
- 压力(如果有)
- 倾角/IMU(如果有)
- 页面图像或轨迹渲染图
- 音频上下文(会议/课堂/对话)
Layer 2:通用 handwriting model
负责基础识别:
strokes / image → candidate text
建议使用:
- Transformer / Conformer sequence model
- CTC 或 seq2seq decoder
- online + offline feature fusion
Layer 3:个人 writer profile
每个用户维护一个轻量个人模型:
- writer embedding
- prompt adapter
- LoRA adapter
- 字形偏好表
- 常用缩写映射
- 个人词库
它学习:
- 这个人的 a/t/e 怎么写
- 这个人的“的/是/了/我”怎么写
- 这个人的连笔方式
- 这个人的项目名、人名、术语
- 这个人的缩写习惯
Layer 4:LLM 上下文纠错
大模型负责:
- 拼写修正
- 人名/项目名识别
- 专有名词恢复
- 语境补全
- 句子级别重排
- 根据会议音频辅助修正手写笔记
例子:
memova notbook→Memova notebookmeting followup→meeting follow-upyujing/Yujing根据上下文统一人名
Layer 5:用户反馈闭环
用户每次修正识别结果,系统都应该学习:
- 错字 correction
- 用户真实写法
- 常见词汇
- 个人缩写
- 语境规则
这会让产品形成长期壁垒。
产品化建议
Onboarding
第一次使用时,让用户写一页:
- 英文字母
- 数字
- 常用符号
- 一段自然文本
- 常用项目名/人名
- 中文常用字(如果做中文)
产品话术:
写一页,让 Memova 学会你的字。
持续学习
之后不要求用户专门训练,而是在自然使用中学习:
- 用户改错一次,系统记住
- 用户经常写某个项目名,系统自动加入个人词库
- 用户每次写完会议笔记,系统结合音频和上下文校正
隐私策略
个人笔迹属于敏感生物/行为特征数据,建议:
- local-first 保存 writer profile
- 默认不上传原始笔迹轨迹
- 上传云端时明确 opt-in
- 支持导出和删除个人 writer model
这和 Memova 的 local-first 叙事高度一致。
对 Memova Pen 的战略判断
不要把核心卖点做成:
OCR 很准。
更好的卖点是:
Memova Pen 越写越懂你,把手写、声音和上下文变成可行动记忆。
Livescribe / Neo Smartpen 解决的是:
我写了什么。
Memova Pen 应该解决的是:
我为什么写、这和谁有关、接下来该做什么。
最终判断
你的假设成立:
大模型 + OCR/HTR + 个人轨迹适配,可以显著提升手写识别准确率。
但推荐实现方式是:
通用 handwriting foundation model + 每个用户一个轻量 writer profile + LLM 上下文纠错。
这条路线比“每人预训练一个模型”更便宜、更快、更适合本地化,也更符合 Memova 的长期定位。
手写笔记自动识别:轨迹个性化预训练 + OCR + 大模型的技术可行性
1. 结论摘要
技术上,**用每个人的手写轨迹做个性化预训练或适配,确实有机会显著提高识别准确率**。
更准确地说,这个方向不是传统意义上的普通 OCR,而是以下几类技术的组合:
Online Handwriting Recognition
+ Writer Adaptation / Personalization
+ Offline OCR / Image-based HTR
+ LLM Post-correction / Contextual Reranking
核心判断:
- **个人笔迹差异是手写识别中的主要误差来源之一**。
- 轨迹数据包含静态图像 OCR 看不到的信息,例如笔顺、速度、停顿、连笔、抬笔、方向。
- 对每个用户做轻量级个性化适配,比从零训练一个用户专属大模型更现实。
- 大模型更适合做后处理、纠错、上下文理解和结构化,而不是直接替代底层手写识别模型。
因此,更合理的系统路线是:
通用手写识别模型
↓
每个用户的笔迹轨迹个性化适配
↓
图像 OCR / 轨迹模型融合识别
↓
LLM 基于上下文纠错、重排、总结、结构化
2. 相关论文方向
2.1 个性化手写识别:MetaWriter
**MetaWriter: Personalized Handwritten Text Recognition Using Meta-Learned Prompt Tuning**
这篇论文非常贴近“每个人的笔迹个性化适配”这个方向。
论文核心观点:
- 现代 Handwritten Text Recognition, HTR, 面对多样化书写风格仍然困难。
- 传统方法缺少 test-time 的 writer-specific personalization。
- 作者将个性化建模为 prompt tuning。
- 通过自监督图像重建任务,在测试时适配具体写作者。
- 只更新极少量参数,而不是全量 fine-tune。
启发:
不需要给每个用户训练一个完整模型。
可以为每个用户训练一个小型 prompt / adapter / embedding。
论文链接:
https://arxiv.org/abs/2505.20513
2.2 显式建模 writer style
**Towards Writing Style Adaptation in Handwriting Recognition**
这篇论文关注如何把 writer style 显式引入手写识别模型。
论文核心观点:
- 手写识别的挑战之一,是不同写作者的书写风格差异很大。
- 很多 SOTA 方法没有显式使用 writer style 信息。
- 作者提出 Writer Style Block,用 writer identity 作为条件输入。
- 模型学习 writer embedding,并根据写作者风格调整识别。
启发:
产品中可以为每个用户维护一个“笔迹风格 embedding”。
这个 embedding 不一定要保存原始笔记内容,也可以只保存风格表征。
论文链接:
https://arxiv.org/abs/2302.06318
2.3 在线轨迹 + 离线图像融合
**A Transformer Based Handwriting Recognition System Jointly Using Online and Offline Features**
这篇论文直接对应“轨迹 + OCR/图像”的融合路线。
论文核心观点:
- 手写识别同时受益于两类信息:
- rasterized glyph image,也就是最终写出来的图像;
- pen trajectory,也就是书写过程中的笔尖轨迹。
- 过去很多系统只用其中一种信息。
- 作者使用图像 encoder 和轨迹 transformer 进行 early fusion。
- 在相关数据集上达到 SOTA。
启发:
OCR/图像负责“最后长什么样”。
轨迹负责“怎么写出来的”。
两者融合通常比单独使用 OCR 或轨迹更稳。
论文链接:
https://arxiv.org/html/2506.20255v1
2.4 轨迹特征的重要性:path signature + pen-tip trajectory
一篇 2024 年 Nature / Heritage Science 论文研究了在线手写识别中的轨迹特征。
论文核心观点:
- 在线手写可以捕捉坐标点、笔尖运动等动态信息。
- path signature 可以表示空间结构。
- pen-tip trajectory 可以表示笔顺、方向、时间动态。
- 二者融合能提升识别效果。
启发:
轨迹不是附加信息,而是关键识别信号。
尤其对草写、连笔、复杂字符、相似字形有价值。
论文链接:
https://www.nature.com/articles/s40494-024-01489-7
2.5 LLM 用于手写识别后处理
**Benchmarking Large Language Models for Handwritten Text Recognition**
这类研究表明,大模型在 Handwritten Text Recognition 中有价值,但要谨慎使用。
主要结论:
- LLM / 多模态大模型在英文现代手写上表现较强。
- 在非英文、历史文档、复杂手写上表现不稳定。
- LLM 的自我纠错并不总是可靠。
- LLM 更适合做候选结果重排、上下文纠错和结构化。
启发:
LLM 不应该作为唯一识别器。
更适合放在后处理层。
合理流程是:
轨迹 / 图像模型输出 n-best candidates 或 token probabilities
↓
LLM 根据上下文、用户词库、联系人、项目名进行重排和纠错
↓
输出更自然、更结构化的笔记文本
论文链接:
https://www.sciencedirect.com/org/science/article/pii/S0022041825000323
3. 对“个人轨迹预训练是否能显著提高准确率”的判断
这个假设基本成立,但更准确的说法不是:
给每个人从零预训练一个大模型
而是:
先训练一个通用 handwriting foundation model
再对每个用户做 per-user adaptation
推荐路线:
Foundation handwriting model
↓
Per-user adapter / LoRA / prompt tuning / user embedding
↓
User-specific recognition
原因:
- 单个用户的数据通常不足以从零训练大模型。
- 但足够训练一个小型适配层。
- 用户的修正行为可以持续产生高质量监督数据。
- 轨迹数据可以通过自监督任务学习,不完全依赖人工标注。
4. 推荐产品技术架构
4.1 输入层
如果目标是“任何纸上手写,自动数字化成文字”,系统最好采集以下信息:
笔尖轨迹:
- x
- y
- timestamp
- pen-up / pen-down
- stroke_id
- pressure,可选
- tilt,可选
纸面图像:
- 单词 crop
- 行图像
- 页面图像
- 笔迹位置
上下文:
- 前后几行文字
- 用户常用词
- 联系人
- 项目名
- 日历词汇
- 公司名
- 专有名词
最低可用轨迹格式:
(x, y, timestamp, pen_state)
其中 pen_state 表示当前是落笔还是抬笔。
4.2 模型层
推荐使用三模型组合:
1. Trajectory Encoder
Transformer / SSM / BiLSTM-CTC
2. Image Encoder
CNN / ViT / Swin + CTC 或 seq2seq decoder
3. Fusion Decoder
CTC / Transducer / Transformer decoder
在此基础上加入:
User Embedding / Adapter / LoRA / Prompt Tuning
系统结构示意:
Pen trajectory ────────┐
├── Fusion model ── Base recognition candidates
Paper image / OCR ─────┘
↓
User-specific adapter / embedding
↓
LLM reranking / correction / structuring
↓
Final digital notes
5. 个性化训练方式
5.1 阶段 A:冷启动
用户刚开始使用时,使用通用模型识别。
特点:
- 不需要用户提供训练集。
- 准确率取决于通用模型能力。
- 适合获得第一版识别结果。
5.2 阶段 B:隐式个性化
用户每次修改识别结果,都可以成为监督数据。
例子:
模型识别: metting
用户修正: meeting
系统可以学习:
- 这个用户如何写双 e;
- 某些连笔模式对应什么字符;
- 该用户常用哪些词;
- 该用户会议笔记中的常见实体。
这类反馈对产品非常重要,因为它不需要额外打扰用户。
5.3 阶段 C:自监督适配
即使用户没有手动修正,也可以通过自监督任务学习笔迹风格。
可用任务包括:
轨迹重建
Masked stroke prediction
下一笔预测
Stroke-to-image reconstruction
Image-to-stroke consistency
Contrastive learning: same writer vs different writer
其中 MetaWriter 的思路尤其适合产品化:
用辅助重建任务做 test-time personalization,
而不是要求用户大量标注。
6. 准确率提升潜力
不同场景下,个性化轨迹适配的提升潜力不同。
| 场景 | 提升潜力 |
|---|---|
| 英文印刷体 / 清晰手写 | 中等,可能提升几个百分点 |
| 草写 / 连笔 / 会议速记 | 很大 |
| 中文 / 日文等复杂字符 | 很大,但 segmentation 更难 |
| 专有名词 / 联系人 / 公司名 | 极大,尤其需要用户词库和 LLM |
| 数学公式 / 箭头 / 图表 | 单纯 OCR 不够,需要结构理解 |
| 极潦草笔迹 | 有帮助,但存在上限 |
我认为最有商业价值的提升不会只体现在 CER / WER 上,而会体现在:
Entity Error Rate
Correction Burden
Searchability
User Trust
例如:
- 人名是否识别对;
- 公司名是否识别对;
- 项目代号是否识别对;
- 用户每 100 个字需要修正多少个字;
- 用户是否愿意把识别结果直接用于工作流。
7. MVP 实验设计
为了验证这个方向,可以做一个小规模实验。
7.1 样本
建议招募:
20–50 个用户
每人 5–10 页真实笔记
笔记类型包括:
- 会议笔记;
- 课堂笔记;
- 待办列表;
- 头脑风暴;
- 混合中英文;
- 含人名、公司名、项目名的真实内容。
7.2 采集数据
每份笔记同时采集:
1. 纸面图像
2. 笔尖轨迹
3. 用户修正后的 ground truth
4. 可选上下文:联系人、项目名、日历词汇
7.3 Baseline 设置
至少比较四组模型:
A. 纯 OCR
B. 纯轨迹识别
C. OCR + 轨迹融合
D. OCR + 轨迹融合 + per-user adapter
如果要进一步验证 LLM 价值,可以加:
E. OCR + 轨迹融合 + per-user adapter + LLM reranking
7.4 评估指标
建议使用:
CER: Character Error Rate
WER: Word Error Rate
Entity Error Rate: 人名、公司名、项目名识别错误率
Correction Burden: 每 100 字用户需要改多少字
Latency: 从书写到可用文本的延迟
User Acceptance: 用户是否愿意直接使用识别结果
其中,产品上最重要的可能不是 CER,而是:
Correction Burden
Entity Error Rate
因为用户真正关心的是:
我还要不要花时间改?
关键名字和任务有没有错?
这份笔记能不能被搜索和总结?
8. 推荐系统路线
最终推荐路线:
Smart pen trajectory model
+ Handwriting image OCR
+ Per-user handwriting adapter
+ User vocabulary / contacts / project lexicon
+ LLM post-correction / summarization / structuring
+ Human feedback loop
更完整的产品闭环:
用户在任意纸上书写
↓
智能笔捕捉轨迹
↓
相机 / 扫描捕捉纸面图像
↓
轨迹模型 + OCR 模型融合识别
↓
用户专属 adapter 提升识别
↓
LLM 根据上下文纠错和结构化
↓
用户修改结果
↓
修改结果反哺个人模型
9. 产品判断
这个方向有明确论文基础,也有产品差异化。
关键机会在于:
- **不用特殊纸**
如果能做到任何纸上写,这会显著降低用户采用门槛。
- **越用越准**
个性化适配可以形成长期用户锁定。
- **从文字识别升级到知识结构化**
不只是把字识别出来,而是自动提取:
- todo;
- meeting summary;
- decision;
- follow-up;
- names;
- dates;
- project references。
- **用户反馈闭环**
用户每次修正,模型就更懂这个人的笔迹和词汇。
10. 最终判断
这个技术路线是可行的。
最合理的判断是:
LLM 不会单独解决手写识别。
OCR 也不会单独解决手写识别。
真正有优势的是:
轨迹 + 图像 + 个人化适配 + 上下文 LLM。
如果产品目标是“任何纸上的手写笔记自动转成可靠文本”,那么最核心的技术壁垒应该是:
1. 高质量轨迹采集
2. 轨迹 / 图像融合识别
3. Per-user handwriting personalization
4. 用户词库与上下文纠错
5. 低摩擦反馈闭环
这套系统一旦跑通,准确率和用户体验有机会明显优于普通 OCR 或传统智能笔记本方案。
Decision
Present Memova to ODMs as a Memory OS and agent-action system spanning five hardware entry points, not as a buyer seeking a quote for one commodity recorder.
Primary message:
One software system, five hardware entry points. Each device captures a different part of real-world context, while Memova turns that context into durable memory and user-confirmed action.
The five current consumer price directions are:
| Form | Price direction |
|---|---|
| Recording card | about US$90 |
| Watch-strap clip | about US$120 |
| Clip-on open-ear headphones | about US$150 |
| AI glasses | about US$200 |
| Memova Pen | about US$500 |
These are retail price directions, not target BOMs or final commitments.
ODM Added Value
Memova can help an ODM move from one-off manufacturing into reusable AI-native reference designs:
- software differentiation and potential ASP uplift;
- one customer relationship expanding across multiple SKUs;
- post-sale feature updates and recurring software value;
- privacy, consent, local-first processing, user confirmation, and secure data interfaces designed into the device;
- global professional-user positioning and a joint AI-hardware case study;
- aggregated, consented product feedback informing the next hardware generation.
The product distinction is not recording or transcription alone. Memova links captured input to people, projects, decisions, commitments, preferences, and next actions, then writes corrections and outputs back into memory.
External-Claim Guardrails
- “World first” may be used only for Memova's specifically defined Personal Superalignment platform category framing. Do not broaden it into claims that Memova invented personal AI memory, LLM Wiki, knowledge bases, or AI alignment.
- The earlier US$1.5M financing target is historical planning language and must be refreshed against completed financing before reuse.
- Founder revenue history, team roles, and academic credentials require approved public wording.
- Medical, legal, and accessibility use cases are research/target markets, not clinical or professional efficacy claims.