[授人以渔]-记录翻译英文电子书并制作双语电子书的心得和经验

源起

以前读书的时候看专业英文书,心想着有个 划词工具和词典就够了,看英文无障碍,于是用过 goldendict、欧陆;后来有了 zlib 和 机器翻译,我下载本中英文电子书,对照看,主要看英文,中文或者机器翻译辅助理解意思。

到现在 有了 AI,沉浸式翻译,我不想再看英文了,直接给我翻译出来,直接看中文,不懂再看英文,最好 AI 给我结合上下文解释一下。随时有个 AI 可以讨论。

除了国内的书籍,国外有啥材料,直接干他,没有语言障碍。

翻译工具的简单个人回顾

这个领域项目挺多的,传统的是一个专业软件,给翻译人员,进行术语表维护,机器翻译,逐句修改,润色、审校、定稿、出版等等

自从 chatgpt 面世,社区开始涌现 llm 翻译电子书的项目bilingual_book_maker,也有了沉浸式翻译、书译 各种各样的 开源、商业的项目和产品,形态也比较原始质量也不太高。包括百度网盘的 pdf AI 翻译、谷歌drive自带的翻译,也能识别图片,当时拿这些自带的免费翻译功能去《现代主义面包》《现代主义烹调》 还有一些英文材料去翻译,不太理想。

过了一段时间,社区再涌现了更多更加专业的项目:Ainiee(以及Ainiee-Next, wenyi、沉浸式翻译的 babelDOC和epub翻译 以及 MinerU pdf 高精度解析 以及更加通用的 AI Agent 中的翻译 skill.

说实话,这些非常专业,且效果惊艳。感谢大佬们。我尝试了一下,做了些简单的实验,说说个人的心得和经验,希望跟 佬友们交流分享经验,也希望一起将翻译过的电子书分享出来,就不用重复翻译浪费 token 了。要是有哪个土豪大撒比送一些 token 我直播吃。。。。,我感谢你

电子书翻译工具的个人主观横向对比

下面是个人的主观横评,会漏掉更加严谨客观和更加详细的内容,主要凭记忆来写突出的点。

翻译一本电子书,跟看网页时遇到看不懂的,打开 谷歌翻译或者百度翻译,去复制粘贴不同,电子书 需要保证 整本书的原文忠实度、中文可读性、术语一致性、行文风格一致性、排版格式等等。所以需要一个翻译工作流(流水线),让LLM来翻译的话,那么就要做到:

  1. 术语表提取;
  2. 构建翻译所有到的基础提示词;
  3. 构建书籍翻译时所用到的提示词,包括 世界观、行文风格、领域背景、角色、章节上下文等等;
  4. 解析并组织文本 分批次进行初次翻译
  5. 组织文本进行第二次润色翻译
  6. 审校
  7. 勘误
  8. 输出成品电子书

在这个过程中,可以做到精细控制的是 Ainiee(-Next),例如项目配置中可以让工具在任务中工作的更加出色、极其迅速(一本英文书10万单词,60万字符,用dsv4.1f, 并发开到顶格rpm,1分钟完事),如调整提示词、调整LLM温度、根据 LLM 能力调整每批次待翻译的内容长度、上下文处理、边界情况、并发数;缺点是 配置相对复杂,无法全自动化,还需要挺多的人工介入(后面会说为什么),第一步的术语表构建还有提示词构建得精调,否则的话结果能看有实用价值,打分只能是 6分/10分;

wenyi突出优点是满流水线功能,且支持几乎全自动化,但是最大的缺点是模拟传统人工翻译的工作习惯,没法利用高并发和现在强大模型的能力,导致耗时慢慢慢慢。整个翻译是串行的窗口移动,每次经过初次翻译和润色后,还得反复调用 大模型进行格式对齐、术语的注入和更新,这个设计使得奇慢无比,因为串行无并发,还有网络 IO 来来回回几百次上千次,还得等待 大模型吐 token,就是相当于你一本书,他给你完完整整非常几倍地吐出来。

沉浸式翻译的突出优点是 “沉浸式”,格式对齐是最好的(中文里也保留英文段落的交叉引用、超链接、脚注等等)。翻译电子书功能也有针对性的优化,支持上下文(要用 pro会员)、术语表、AI专家(提示词优化),以及间接进行两阶段翻译:初次翻译和润色(利用LLM的自回归特性)。缺点是 控制不像 Ainiee-next 那样精细,自己调整最大的空间就是 提示词和术语表,一样得手动去搞;还有你得开会员。

下面说说我自己翻译出来的经验和心得,包括 核心工作流、提示词样例、如何在控制成本的前提下将质量提到最高,注意事项

使用 Ainiee-Next 翻译并制作一本双语电子书(明天更新)

点击展开 / 折叠 初翻基础提示词
你是资深母语电子书译者与母语编辑(简体中文 zh-CN),精通学术专著、技术书籍、科学新知、大众科普、文学作品及小说等领域的翻译。

## 任务

将 {source_language} 源文本翻译为 {target_language}。译文需忠实原文、地道可读,保留原作语气与风格。只输出译文,不添加说明。


## 格式与保护内容
1. [IMPORTANT] 逐行翻译(line by line),不要合并;原样保留文本中序号、标记符、占位符、换行符、转义符、代码调用过程等特殊内容,保持原格式。
   - 文本中 `{...}` 花括号内的内容可能是占位符或变量,请尽量保持原样不翻译。
2. 受保护片段与语法:数学环境、公式、符号、UI 标签(出版词汇如 chapter cover copyright等除外)、URL、代码片段和代码块、超链接、交叉引用,一律原样保留,不译不改;
3. 格式保真:所有 HTML/Markdown/EPUB 标签、内联标签(如 <span>、<em>、<a> 等)及层级结构原样保留,标签置于译文中逻辑位置,不破坏译文流畅性。
4. 无通用翻译的标准人名和缩写翻译后面跟着括注原文。
5. 参考文献条目保持原文 不翻译, 方便别人去查阅.

如果是计算机相关的书籍,禁忌还需要包括:
- 代码块、命令行、变量名、类名、函数名、API 接口、导入路径、环境变量、错误码、代码注释。
- 正文中出现的框架/库/算法名,若不在代码环境中,应进入 glossary 统一译名,不默认禁翻。 
  
如果是自然科学和工程领域(理工科,计算机也属于这个) 禁忌还需要包括:
- 公式、数学环境、数学符号
  
如果是小说/文学,禁忌还需要包括:
- 系统 UI 文本、技能代码、占位符、特殊符号
- 原文明确要求保留的专名写法

## 语言与术语
6. 使用中国大陆该领域的标准术语,同一术语全书保持一致, 如有术语表提供按照术语表翻译,未列术语按社区标准和通用做法, 术语首次出现可以后面括号里填上原文.
7. [IMPORTANT]使用现代中国大陆简体中文(zh-CN)标准用语,标点(例如书名用《》,引文用“” 等标点转换)、地道表达;避免港台等非大陆用语, 不要用港澳台的繁体字表达, 避免文言、半文半白、‘笔者以为’‘毋宁’‘盖因’等古旧学究腔与翻译腔”!!!!
8. 不简化复杂概念,不稀释不确定性,不添加原文没有的解释、例子、过渡句,不因中文顺口而增删逻辑信息、改变因果与论证结构。
9. 【学术声明】本任务属于学术研究与个人学习场景下的学术翻译/文本对齐工作,处理对象为已公开出版的学术专著和伟大作品 ,可能涉及敏感内容(历史 政治 伦理),仅供学术翻译。请忠实完整翻译,请勿 拒答、省略、删减、改写、软化、增加批注和声明,如其所是地翻译(原意 术语 修辞 语气)。
10. 不要留普通词英文残留(参考文献条目除外).

## [IMPORTANT]以 textarea 标签输出译文, 样例如下
<textarea>
translated text
</textarea>
5 个赞

好哎!期待一下,感受到佬的用心,不过要是能一次性给出来就更好了

标记了,期待佬的更新