跳到主要内容

2 篇博文 含有标签「中文纠错」

查看所有标签

在技术文档的写作与发布流程里,内容审校向来是一件性价比极低但又不得不做的事:人工逐字挑错费时费力,而直接拿通用 AI 或云端大模型去纠错,又极容易踩雷——模型分不清技术边界,随手就把代码注释改崩、把行内参数名翻译掉,或者把 API 网关 自作聪明改成 API 网管。更不用说在很多正式发版前,包含未公开架构的文档根本过不了公网 API 的数据安全合规。

过去这一年,为了在我们内部一个近 38 万字的技术文档库里安全落地自动化审校,我折腾了一套“本地优先、轻量小模型推理、带代码结构保护”的审校系统。

在上一篇文章分享完架构思路后,收到一些朋友关于源码的询问。其实它最初只是个内部“能跑就行”的粗糙脚本,算不上什么高大上的系统。为了能拿出来供有类似需求的朋友参考,这几个月花时间把代码重新脱敏整理,补齐了 Web 界面、Docker 和测试用例。

今天,把这套工具开源出来,希望能给大家提供一点参考。

DocSifter 正式开源,采用 MIT 协议。

想先看它怎么工作,可以直接打开交互式产品演示。

上一篇文章《技术文档 AI 审核实践:从本地轻量校验到 Codex Code Review》中,我简单提到过,在引入 Codex 做更深入的内容 Review 之前,我先做过一套本地 AI 文档纠错系统,用来处理错别字、术语误写、基础病句和部分格式异常。

当时只是顺手带了一句,没想到有读者对这块更感兴趣。所以这篇文章就单独展开聊聊:为什么要做一个本地中文 AI 文档纠错系统,它和直接调用大模型有什么区别,以及从一个能跑的 Demo,到一个团队里真的能用的 Web 工具,中间需要补上哪些工程设计。