想问问用哪些模型做翻译效果最好,正在做重视质量的塞尔达旧作汉化

顺便打个广告:本项目是用爱发电的怀旧游戏汉化,感兴趣的话欢迎加入,技术/QA/日翻/日校都缺人…

目前的思路是:将输入的原始文本结构化,尽量从数据角度多挖一些背景上下文(理想情况是出现位置、说话人等,但老游戏+逆向挖不出来那么多信息…基本只有index:content的键值对了),再辅以术语库,交给多个LLM进行初翻,由旗舰模型(目前只有条件用astra,没A/的号)进行裁决,最终人工审校

随着Agent能力的增强,现在出现了非常多的AI汉化,但大多都还局限在单一模型甚至直接让干活的agent来翻译,质量良莠不齐。私认为这套思路跑通后,还可以完善一下,开源给其他汉化人员使用?

但在LLM选型上目前还没拿定主意

在机器翻译专用模型方面,本地部署了Hy-MT2-30B-A3B Q4KM,但尚不清楚翻译专用模型的质量是否会好于旗舰模型
考虑选旗舰国模(4.1flash/qwen3.8max?)以及基础外模luna(grok和gemini没用过也没号)
曾听闻gpt-4o最会说人话,但是目前找不到渠道调用

Q: 想问问各位佬对翻译模型选型有什么建议吗?设计为裁决者的astra的中文能力是否适合做这件事?

一些无关紧要的背景

为了庆祝塞尔达传说系列40周年,我们汉化组开了几个坑
首先是塞尔达系列的术语库,现在塞尔达系列已经有数十部官方中文作品了,而官中的译名其实也随时间存在变动(主要趋势是繁体译名取代简体,例如盖侬->加侬、静谧公主->宁静公主),再加上早期存在很多民间汉化,现状是译名遍地开花,很多玩家/粉丝都不太搞得清楚某个名词的最新官方译名了。
所以我提取了官中各作的日英简繁文本,借助agent的力量来整理术语库


之前用deepseek-v4.1-flash做的前端,打算等后端/数据层搞的差不多了再用astra/opus5.5重做…

既然都有了这盘醋就又想包饺子了,于是就开了《不可思议的帽子》(缩小帽)和《风之律动HD》(风之杖)的坑

不过为什么选这两作呢

《不可思议的帽子》(缩小帽) 在老塞尔达里属于很多人的启蒙作,怀旧声量较大,也有成熟的反编译工程
《风之律动HD》(风之杖) 则是3D塞尔达官方译名汉化的最后一块拼图(时之笛/黄昏公主/御天之剑都有官方中文了),而且我也正好有NGC/Wii U汉化程序的相关经验


但每作的文本量都有十几w日文,这年头日翻也不好招…虽然我们确实算个汉化组,但只有固定的技术(我)和美工人员,介于今年在高强度使用Agent,就想着让LLM来做翻译

主要在于术语库的问题,实际上旗舰模型的质量还是会可能比较好的,这个最好是你先抽样调研下这些的模型 翻译模型的话 主要的好处是速度可能比较快(

我也是这么觉得,私认为本地部署翻译专用模型主要在于性价比,重视质量的情况下可能还是越大越好(

主要翻译这种东西都比较古早了 现在基本上随便哪个模型来 都没啥问题()

但现在前沿模型的趋势是重codiong轻文字,不知道拿来做翻译还讲不讲人话了(

佬是做无偿的公益汉化吗?是不是可以商业化募资或者相关的从业人士去处理?

:smiling_face_with_three_hearts: 翻译其实算比较基础的任务了 基本都比较简单,不行就拿点 讲人话的模型来跑 比如国产模基本都还不错的()

是的,“汉化” 领域基本都是用爱发电的组织,有商业体系的一般是发行商/开发商找的专门的本地化 团队了

塞尔达是天!支持楼主!话说风杖是不是该重制了

黄昏HD和风棍HD作为Wii U就高清化过的遗产,上NS的风吹了好多年了,至今还是没有动静…

目前翻译体感最好的还是美国豆包…其次是ds(便宜)

在我们领域gemini的翻译是最强的,特别是小语种

英译中不好说,但是日译中本地小模型我个人觉得没法跟在线大模型比,特别是在指令遵守和格式保持方面。如果是以前我会推荐DS,v4以来编程能力提升很猛,翻译水平个人觉得下降了。现在都可以吧,我翻译游戏主用Gemini和GPT,主要是API获取途径方便,翻译水平嘛,各大模型大差不差,感觉没有哪个能拉开档次上的差距,再加上ai翻译本身就有一定的随机性,见仁见智,可以截取一段比较复杂的文本让各大模型试试哪个更符合自己口味。

3.8flash吗 哈基米的pro似乎已拉完

想问问是从什么语言翻译到什么语言呢

感觉关键的还是找懂日语懂游戏的人来校对,最好还懂AI来写一写md来限制大模型,翻译对于现在的大模型都是小儿科

我翻译的是伊拉克的一种方言,缩写ckb

翻译的话我以前都是用的ds模型,因为以前价格便宜,翻译效果还ok,我觉得astra排查问题的话还是可以的,不过可以适当穿插opus模型,因为在这种感性方面,opus模型还是更灵动一点。

我一般都翻译黄油,所以感觉没什么区别,我感觉现在的模型基本上都能好好的翻译出来,但要翻译的更有人味一点的话还是需要好好校对。

我以前都是让ai先把当前游戏里不影响代码的和用户可见的文本提取成类似mtool导出翻译文件的json格式,为了防止遗漏我会多问一句确定都提取了吗,然后塞LinguaGacha里翻译完回填的,这个工具的校对我感觉蛮不错的,回填完也会问一句确定都没问题了吗,最终弄出的结果还不错的。

根据我上半年的翻译经验来看的话,我感觉最重要的就是术语库了,这个最开始弄好后边会省不少力气,然后就是校对了,校对比翻译更费时间,要不断去根据上下文翻译成合适的,因为主角可能除了真名还有各种昵称,同一个词在不同上下文可能有不同意思,然后就是一些嵌在图片里的文字ui,需要纯p图,我之前不会让opus4.8弄得,我还记得我翻译用了一天,校对了两个月,ui让ai汉化又弄了两个月,从3.1到8.25,总之,挺费时间的。

不论怎样,还是挺佩服佬友的,可能要花很久时间的,祝佬友成功吧

就我的经验来说,本地微调过的7B模型都能有较好的翻译质量,更别提线上的超大模型,这点基本上不用太担心,模型不说人话的问题一般是在创作的时候,翻译的时候还是不太会偷工减料的。

实际上,更多的时候这两件事会更加影响翻译质量:1、术语表没管理好导致同一专有名词被翻译成不同名称、不同性别等;2、解包拆出来的句子不连贯导致模型对着不连贯的文本块翻译。

感谢佬友的巨著,用astra是因为只有gpt…看来得想想办法薅点claude来用了。
文本部分有古法汉化的经验指导,Agent成功实现了完整提取+二进制一致的回写,目前主要问题是老游戏基本只有index:content,能交给LLM的背景信息不足
术语库确实是控制性工程,也是最麻烦的,开了九百多个luna子代理了还是没到满意的程度,可能是语料文本量还是太大了,持续推进中…
图片UI我们有固定的美工,而且工作量相比文本小的很多,还是在用古法汉化