---
title: FireRedPunc-ONNX
canonical_url: "https://www.modelscope.cn/models/42ailab/FireRedPunc-ONNX"
md_url: "https://www.modelscope.cn/models/42ailab/FireRedPunc-ONNX.md"
repository: 42ailab/FireRedPunc-ONNX
last_updated: 2026-07-17
license: apache-2.0
pipeline_tag: text-generation
tasks:
  - text-generation
library_name:
  - onnx
frameworks:
  - onnx
language:
  - zh
  - en
downloads: 0
stars: 1
tags:
  - punctuation
  - onnx
  - bert
  - asr
---

# FireRedPunc-ONNX

> FireRedPunc-ONNX - 42ailab 在 ModelScope 开源的模型。FireRedPunc · 全本地中英文自动标点

42ailab/FireRedPunc-ONNX 是 ModelScope 魔搭社区上的text-generation模型，采用 apache-2.0 许可。

- **Repository**: 42ailab/FireRedPunc-ONNX
- **License**: apache-2.0
- **Tasks**: text-generation
- **Tags**: punctuation, onnx, bert, asr
- **Downloads**: 0
- **Stars**: 1
- **Last updated**: 2026-07-17

Source: https://www.modelscope.cn/models/42ailab/FireRedPunc-ONNX

---

<!--
  这是 ModelScope / HuggingFace 仓 `42ailab/FireRedPunc-ONNX` 的 README，随包上传。改这里 = 改仓首页。
-->
# FireRedPunc · 全本地中英文自动标点

[![License: Apache 2.0](https://img.shields.io/badge/License-Apache_2.0-blue.svg)](https://www.apache.org/licenses/LICENSE-2.0)
[![Runs Local](https://img.shields.io/badge/Runs-100%25_Local-brightgreen.svg)](https://42model.com)
[![Platform](https://img.shields.io/badge/Platform-macOS_|_Windows_|_Linux-lightgrey.svg)](https://42model.com)

给一段**没有标点**的语音转写文字，本模型自动补上标点（中文逗号、句号、问号、感叹号；英文 , . ? ! 及首字母大写）——让机器转出来的「一大段没断句的文字」变成通顺可读的句子。全部在你自己的电脑上完成，**不上云、免费、私密**。

> **模型由[小红书 FireRedTeam](https://github.com/FireRedTeam/FireRedASR2S)研发、以 Apache-2.0 开源**（FireRedPunc，基于中文 BERT 的标点预测模型）。**本仓不是新模型**：模型能力归 FireRedTeam；我们（活水 AI 实验室）把它的原始权重**转换成可离线运行的量化 ONNX 文件**（int8）并做了质量校验，纳入[活水模型](https://42model.com)引擎的转录高配——我们做的是「让它在你电脑上开箱即用」。

## 一、它解决什么问题

语音识别（ASR）出来的文字，很多模型**不带标点**——一整段话没有逗号句号，读起来费劲、也不好做字幕、摘要、检索。给转写结果自动加标点，是把「能听懂的机器文字」变成「能读的人类文字」的关键一步，但好用的中文标点模型常有两道坎：

- **中英混排**：中文用全角「，。？！」、英文用半角「, . ? !」且句首要大写——规则不同，很多模型只顾一头；
- **要不要上云**：转写内容常涉及隐私（会议、采访、备忘），再传一次到别人的服务器加标点并不放心。

本模型两样都顾到：**中英文都准**、**完全本地**。转写高配「一站式」里转写完就顺手加好标点，全程不出你的电脑。

## 二、它是怎么做到的

**模型能力来自 FireRedTeam 的 FireRedPunc**——一个基于**中文 BERT**（chinese-lert-base 底座）的**序列标注**模型：把转写文字逐字读一遍，判断每个字/词后面该不该加标点、加哪个。它是 FireRedASR2 系列「一站式 ASR 系统」里的标点模块。

**我们做的**：把 FireRedTeam 开源的 PyTorch 权重**转换成一个 int8 量化的 ONNX 文件**（约 102 MB，从原始 388 MB 大幅压缩），让它**在普通 CPU 上就能流畅运行**、无需显卡；并**在活水模型引擎里端到端复核**了输出（见下节）；许可**沿用上游 Apache-2.0 不变**。跨 macOS / Windows / Linux 本地运行。

## 三、效果如何

**模型本体的完整评测以 FireRedTeam 官方报告为准**（[技术报告](https://github.com/FireRedTeam/FireRedASR2S)）。官方数据显示 FireRedPunc 在中英文标点预测上表现领先：

| FireRedTeam 官方报告 | FireRedPunc |
|---|---|
| 中英文标点平均 F1（越高越好） | **78.90%**，领先 FunASR-Punc（62.77%） |

**我们自己的复核**（活水模型引擎，纯 CPU）：

| 我们校验的项目 | 结果 |
|---|---|
| 量化保真（int8 ONNX vs 官方全精度 PyTorch，逐值比对同一批文本） | 输出**逐字一致**（中文、英文、中英混说样本均通过） |
| 运行设备 | 无需显卡，普通 CPU 即可 |

也就是说：把这套本地部署档接进我们的引擎后，加标点结果与上游全精度模型**逐字相同**——量化没有带来可见的质量损失。

## 四、局限与下一步

- **标点是「预测」不是「规定」**：模型按语料统计给出最可能的断句，偶有与人的习惯不同的地方（尤其口语化、超长句、专业术语密集时）；识别文本本身以主转写为准，标点在其上叠加。
- **专为转写文字设计**：输入是 ASR 转写的连续文字，不是任意书面文本；对已带标点或格式化文本效果非其所长。
- **随转写高配一起用**：本模型不单独下载使用，而是作为[活水模型](https://42model.com)「智能转录」高配的一部分，转写完自动加标点（可在设置里开关）。

## 五、怎么下载与使用

本模型专为 [活水模型（42model）](https://42model.com) 打包，随「转录高配」一起获取：

**桌面版**：在「模型库」→「智能转录」里下载高配 **FireRedASR2-AED**（含标点），转录时在参数里开「标点」即可。

## 文件与许可

| 文件 | 作用 |
|---|---|
| `punc.int8.onnx` | 标点预测模型（int8 量化 BERT） |
| `tokenizer.json` | 中文 BERT 分词器（WordPiece） |
| `out_dict` | 标点类别表（无标点 / ，。？！ 五类） |

各文件 sha256 见仓库文件页，可自行校验。

**许可**：模型本体为 FireRedPunc，© 小红书 FireRedTeam，**Apache-2.0**（官方源：[GitHub](https://github.com/FireRedTeam/FireRedASR2S) · [ModelScope](https://modelscope.cn/models/xukaituo/FireRedPunc)）。本仓为其转换的 int8 ONNX 本地部署档，同样遵循 [Apache-2.0](https://www.apache.org/licenses/LICENSE-2.0)，使用即表示同意上游许可条款。

## 引用

**模型本体**请引用上游 FireRedTeam：

```bibtex
@article{xu2026fireredasr2s,
  title={FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System},
  author={Xu, Kaituo and Jia, Yan and Huang, Kai and Chen, Junjie and Li, Wenpeng and Liu, Kun and Xie, Feng-Long and Tang, Xu and Hu, Yao},
  journal={arXiv preprint arXiv:2603.10420},
  year={2026}
}
```

若**本仓的 int8 ONNX 本地部署封装**对你有帮助，可另附：

```bibtex
@misc{yang2026fireredpunconnx,
  title        = {FireRedPunc-ONNX: A Local Quantized Build of FireRedTeam's FireRedPunc},
  author       = {Yang, Zhiping},
  year         = {2026},
  howpublished = {\url{https://modelscope.cn/models/42ailab/FireRedPunc-ONNX}},
  organization = {42ailab},
  note         = {int8 ONNX 量化与本地部署封装；模型本体为 FireRedTeam FireRedPunc（Apache-2.0）。Contact: contact@42ailab.com}
}
```

联系我们：**contact@42ailab.com**

## 关于我们

**[活水 AI 实验室（42ailab）](https://42ailab.com)** — 源自 2023 年成立的活水智能团队，致力于以认知科学为基石，推动人工智能与人类智能的深度融合与科学创新。

**[活水模型（42model）](https://42model.com)** — 由活水 AI 实验室打造的「你的 AI 模型引擎」，致力于让 AI 能力回到你自己的设备上本地运行——翻译、转写、识别、对话、编程皆免费而私密，跨 macOS / Windows / Linux；并可借云端算力微调出专属模型，训练完成后回传本机私密运行。
