第06章:术语库与翻译知识
6.1 本章概述
在工程图纸翻译中,术语的一致性和准确性是衡量译文质量的核心指标。试想一个场景:同一份结构图纸中,”混凝土强度等级”在第三层平面图被译为”Concrete Strength Grade”,在第五层平面图却被译为”Strength Class of Concrete”,而在基础详图中又变成了”Grade of Concrete Strength”——这种同一术语多种译文的混乱,对于海外业主和监理而言是不可接受的,轻则引发澄清沟通成本,重则导致工程误解甚至返工。
术语库(Glossary)正是为解决这一问题而设计的核心组件。它如同本专业的”翻译字典”,预先定义了每个术语的标准译文,确保同一术语在所有图纸、所有批次翻译中的译法严格一致。
更进一步,同文的翻译知识系统并非只有术语库这一层。它构建了四层翻译知识体系——人工修正记忆(CM)、翻译记忆(TM)、术语表(Glossary)和大语言模型(LLM)——按优先级逐层匹配,既保证了术语的权威性,又兼顾了翻译的灵活性和可积累性。
本章将从上到下、从概念到实操,系统讲解术语库的全部功能、CSV术语表格式的每一个细节、翻译记忆(TM)与人工修正记忆(CM)的工作原理,以及四层翻译知识的优先级机制和最佳实践。
本章阅读建议:如果您是术语表的新手,建议从 6.2 节开始顺序阅读,了解术语库的基本概念后再进入操作环节。如果您已经有术语表管理经验,可以直接跳转到 6.5 节(CSV格式详解)或 6.11 节(优先级机制)进行针对性学习。如果您正在配置团队翻译项目,6.13 节(最佳实践)和 6.8 节(全局 vs 项目术语表)对您最有帮助。
6.2 术语库概述
6.2.1 什么是术语库
术语库(Glossary)是一个结构化的术语集合,用于在翻译过程中对特定词汇或短语提供标准化的译文。在同文中,术语库以 CSV 文件为载体,每一条术语记录包含原文、译文、语言对、专业领域、优先级等完整信息。
可以这样理解:日常使用的词典是”一个词 → 多种解释”,而术语库是”一个词 → 一个确定的译文”。这种确定性是工程翻译的刚需。
6.2.2 为什么需要术语库
在 CAD 图纸翻译中,术语库的必要性体现在以下几个层面:
| 需求层面 | 具体问题 | 术语库的作用 |
|---|---|---|
| 一致性 | 同一术语在不同图纸中出现不同译法,造成交付质量参差不齐 | 确保相同原文在任何时候、任何图纸中都输出相同译文 |
| 专业性 | 通用翻译引擎不了解工程专业术语,可能将”女儿墙”译为”daughter wall”而非”parapet wall” | 用专业术语约束翻译引擎,输出符合工程规范的译文 |
| 效率 | 每遇到一个专业术语都需人工查证和输入,1000 条术语意味着 1000 次重复劳动 | 一次录入,永久复用,翻译时自动匹配 |
| 协作 | 多人翻译同一项目,各自凭经验和习惯选词,译文风格不统一 | 团队共享统一术语表,无论多少人参与翻译,术语译法保持一致 |
| 合规 | 涉外项目合同中可能明确要求特定术语的译法(如招标文件中的标准术语) | 将合同约定的术语译法录入术语库,确保交付物合规 |
6.2.3 术语库在整个翻译流程中的位置
在同文的翻译工作流中,术语库处于”知识层”——它为翻译引擎提供专业约束,在翻译执行时介入匹配。其位置如下:
图纸提取 → 原文结构化 → ┌─ 翻译知识系统 ─────────────┐ → 译文生成 → 人工审校 → 回写图纸
│ CM → TM → Glossary → LLM │
└─────────────────────────────┘
具体来说:
- 图纸文字被提取后,每一条原文都会进入翻译知识系统进行匹配
- 系统从最高优先级(CM)开始逐层查找,如果术语表中有对应条目,则直接采用术语表中的译文
- 如果术语表中存在标记为”不翻译”(
do_not_translate=true)的条目,则跳过翻译,原文原样保留 - 如果所有知识层都未命中,最终由大语言模型(LLM)进行翻译
术语表是四层知识中唯一一个由用户主动创建和维护的确定性知识源,其他三层(CM、TM)是使用过程中自动积累的。因此,术语表的质量直接决定了翻译质量的下限。
6.3 术语库页面布局介绍
同文 Studio 桌面工作台中的术语库页面采用经典的”左列表 + 右预览”双栏布局,用户可以在一屏内完成文件浏览和内容查看。
6.3.1 左侧面板:术语表文件列表
左侧面板负责术语表文件的管理和导航,从上到下包含以下区域:
(1)工具栏
位于左侧面板的最顶部,一行横向排列的操作按钮:
| 按钮 | 图标 | 功能说明 |
|---|---|---|
| 🔄 刷新 | 循环箭头 | 重新扫描术语表目录,刷新左侧文件列表。当您在外部手动添加、删除或重命名术语表文件后,点击此按钮使列表与磁盘同步。 |
| 📂 导入 CSV | 文件夹+箭头 | 从本地磁盘选择一个外部 CSV 文件,将其复制(或引用)到术语表目录中,使其出现在文件列表中。 |
| ➕ 新建术语表 | 加号 | 创建一个空白的术语表模板文件(CSV 格式),并自动用系统默认的 Excel 程序打开以供编辑。 |
(2)搜索框
位于工具栏下方,一个文本输入框。输入关键词后,下方的文件列表会实时过滤,只显示文件名中包含该关键词的术语表。搜索不区分大小写。
搜索框对于管理大量术语表的场景尤为实用——当术语表数量积累到几十个甚至上百个时,浏览列表不如直接搜索文件名。
(3)文件列表
占据左侧面板的主体区域,列出术语表目录下所有的 CSV 术语表文件。列表中的每一项显示术语表文件名。单击列表中的任意一个文件,右侧面板将加载并显示该术语表的内容预览。
当前选中的文件会高亮显示,以区别于其他未选中的文件。
6.3.2 右侧面板:术语表内容预览
右侧面板负责术语表内容的查看和快捷操作,从上到下包含以下区域:
(1)预览工具栏
| 按钮 | 图标 | 功能说明 |
|---|---|---|
| 🔄 刷新预览 | 循环箭头 | 重新加载当前选中术语表的内容。当您在 Excel 中编辑并保存了术语表后,点击此按钮使右侧预览与最新文件内容同步。 |
| 📊 用 Excel 打开 | Excel 图标 | 调用系统默认的 Excel 程序打开当前选中的术语表文件,进入完整的表格编辑模式。CSV 文件在 Excel 中呈现为行列分明的表格,方便进行批量增删改操作。 |
| 📂 打开文件夹 | 文件夹图标 | 在 Windows 资源管理器中打开术语表文件所在的目录。方便您直接管理文件(复制、重命名、删除等),而无需手动导航到该目录。 |
| ⭐ 标记/取消全局 | 星形图标 | 将当前术语表标记为”全局可用”或取消全局标记。全局术语表会在所有项目中自动生效,而无需在单个项目中手动引用。(详见 6.8 节) |
(2)数据表格(8列)
右侧面板的核心区域,以只读表格形式展示术语表的内容,包含以下 8 列:
| 列名 | 说明 |
|---|---|
| 原文 | 术语的源语言文本(对应 CSV 文件的 source_text 列) |
| 译文 | 术语的目标语言文本(对应 CSV 文件的 target_text 列) |
| 源语言 | 源语言代码,如 zh-CN、en-US |
| 目标语言 | 目标语言代码 |
| 领域 | 术语所属的专业领域,如 architecture(建筑)、mep(暖通电气给排水)、structure(结构)、material(材料),空值表示”通用” |
| 优先级 | 数值表示的优先级,数值越大优先级越高 |
| 不翻译 | 是否标记为不翻译(true 或 false) |
| 备注 | 自由文本备注信息 |
表格为只读状态,不可在界面内直接编辑。如需修改,请点击”用 Excel 打开”按钮进行编辑。
(3)底部统计栏
位于右侧面板的最底部,显示当前术语表的汇总统计信息,格式为:
共 N 个术语表 · M 条术语
其中 N 为术语表文件总数(对应左侧文件列表中的表数量),M 为当前选中术语表中的术语条目总数。如果尚未选中任何术语表,M 显示为 0。
6.4 术语表文件管理
6.4.1 刷新文件列表
使用场景:当您通过 Windows 资源管理器手动在术语表目录中添加、删除或重命名了术语表文件,左侧文件列表不会自动更新,需要手动刷新。
操作步骤:
- 确认您已经在术语库页面。如果不在,从左侧导航栏点击”术语库”进入。
- 点击左侧面板顶部的 🔄 刷新 按钮。
- 系统重新扫描术语表目录,文件列表更新为最新状态。
- 如果刷新前选中了某个文件,刷新后选中状态将被清除(因为文件列表已重新加载)。
提示:如果您只是通过同文自带的工具操作术语表(如新建、导入CSV),通常不需要手动刷新,系统会自动更新列表。
6.4.2 导入 CSV 术语表
使用场景:您已经有一个外部的 CSV 格式术语表文件(例如从同事处获取、从其他翻译工具导出、或自行在 Excel 中编制),需要将其导入到同文的术语表目录中。
操作步骤:
- 在术语库页面,点击左侧面板顶部的 📂 导入 CSV 按钮。
- 系统弹出 Windows 文件选择对话框,默认过滤显示
.csv文件。 - 在对话框中导航到外部 CSV 术语表文件所在位置,选中该文件,点击”打开”。
- 系统将 CSV 文件复制到同文的术语表目录中。如果目标目录中已存在同名文件,系统会弹出提示询问是否覆盖。
- 导入成功后,左侧文件列表自动刷新,新导入的术语表文件出现在列表中。
- 单击该文件,即可在右侧面板预览其内容。
注意事项:
- 导入的 CSV 文件必须符合同文的列格式要求(详见 6.5 节),否则可能无法正确解析。
- 推荐使用 UTF-8 编码 保存 CSV 文件。如果文件使用其他编码(如 GBK),中文字符可能在预览中显示为乱码。遇到乱码时,请在 Excel 中另存为”CSV UTF-8(逗号分隔)”格式后重新导入。
- 仅支持
.csv扩展名的文件。.xlsx格式的术语表需要先在 Excel 中另存为 CSV 后再导入。
6.4.3 新建术语表
使用场景:您需要从零开始创建一个全新的术语表,然后逐条添加术语条目。
操作步骤:
- 在术语库页面,点击左侧面板顶部的 ➕ 新建术语表 按钮。
- 系统自动创建一个空白的 CSV 文件。文件名通常为默认格式(如”新建术语表.csv”或带时间戳的名称)。
- 系统自动调用 Windows 默认的 Excel 程序打开该文件。
- 新创建的 CSV 文件已经包含表头行(8 列的列名),您只需从第二行开始逐条填写术语数据即可。
- 在 Excel 中编辑完毕后,按
Ctrl+S(或点击”保存”)保存文件。 - 关闭 Excel,回到同文术语库页面。左侧文件列表中已出现新建的术语表。
- 如有需要,您可以右键点击文件进行重命名(在 Windows 资源管理器中操作,或通过打开文件夹按钮进入目录)。
提示:新建术语表后,建议第一时间将其重命名为有意义的名称(如”建筑专业术语表.csv”、”结构专业术语表.csv”),方便后续管理和检索。
6.4.4 搜索术语表文件
使用场景:术语表目录中积累了数十个文件,想要快速定位某个特定文件。
操作步骤:
- 在左侧面板的搜索框中输入关键词。关键词可以是文件名的任意部分。
- 下方的文件列表实时过滤,仅显示文件名中包含该关键词的文件。
- 清空搜索框(删除所有文字),文件列表恢复显示全部文件。
搜索示例:
| 搜索词 | 可能匹配的文件 |
|---|---|
建筑 |
建筑专业术语表.csv、建筑-结构共用术语表.csv |
MEP |
MEP专业术语表_v2.csv、MEP设备清单术语.csv |
2024 |
项目A_术语表_2024.csv |
6.4.5 文件列表的操作与交互
- 单击选中:鼠标左键单击列表中的某个文件,该文件高亮显示,右侧面板加载其内容预览。
- 滚动浏览:当文件数量超出列表可见区域时,可使用鼠标滚轮或列表右侧的滚动条浏览全部文件。
- 右键菜单(如有):部分版本可能在文件列表上提供右键菜单,包含”重命名”、”删除”、”复制路径”等快捷操作。
6.5 CSV 术语表格式详解
CSV(Comma-Separated Values,逗号分隔值)是同文术语表的数据交换格式。理解每一个字段的含义和约束,是正确创建和维护术语表的前提。
6.5.1 列定义
一个标准的同文术语表 CSV 文件包含以下 8 列(以第一行表头标识,从第二行开始为数据行):
(1)source_text — 源文本(原文)
- 含义:需要翻译的原文术语,即在图纸中出现的原始文字。
- 数据类型:文本字符串
- 必填:是
- 格式要求:不包含换行符、制表符等控制字符。如果原文本身包含逗号(
,),需要用英文双引号(")包裹整段文字。 - 示例:
混凝土强度等级、C30混凝土、钢筋保护层厚度
注意:
source_text的值会与图纸中的原文进行精确匹配(大小写敏感、全半角敏感)。如果图纸中是C30 混凝土(中间有空格),而术语表中是C30混凝土(无空格),则不会命中。因此在建立术语表时必须严格依据图纸中的实际写法。
(2)target_text — 目标文本(译文)
- 含义:原文的标准译文。翻译引擎在命中术语时会直接采用此译文,不再进行 AI 翻译。
- 数据类型:文本字符串
- 必填:是(除非
do_not_translate为true,此时译文列可以留空) - 格式要求:与
source_text相同。译文中的逗号需要用双引号包裹。 - 示例:
Concrete Strength Grade、C30 Concrete、Thickness of Concrete Cover
最佳实践:译文应尽量与目标语言的工程规范用语一致。例如,将”女儿墙”译为
parapet wall而非daughter wall,将”地脚螺栓”译为anchor bolt而非foot bolt。
(3)source_language — 源语言代码
- 含义:原文使用的语言,以标准语言代码标识。
- 数据类型:字符串,遵循 IETF BCP 47 语言标签规范
- 必填:是
- 常见取值:
| 代码 | 语言 |
|---|---|
zh-CN |
中文(简体,中国大陆) |
zh-TW |
中文(繁体,台湾) |
en-US |
英语(美国) |
en-GB |
英语(英国) |
ja-JP |
日语 |
ko-KR |
韩语 |
fr-FR |
法语 |
de-DE |
德语 |
ar-SA |
阿拉伯语 |
ru-RU |
俄语 |
- 示例:
zh-CN
注意:语言代码采用连字符(
-)而非下划线(_)。zh-CN是正确的写法,zh_CN不会被正确识别。
(4)target_language — 目标语言代码
- 含义:译文使用的目标语言,格式与
source_language相同。 - 数据类型:字符串,遵循 IETF BCP 47 语言标签规范
- 必填:是
- 常见取值:同
source_language的取值表。 - 示例:
en-US
注意:同一个术语表中可以包含多组语言对的术语条目。例如,一个”建筑通用术语表.csv”中可以同时包含
zh-CN → en-US、zh-CN → ja-JP、en-US → zh-CN等不同语言对的条目。但推荐将不同语言对的术语分表管理(如”中译英术语表.csv”、”中译日术语表.csv”),这样在项目中引用时更清晰。
(5)domain — 领域
- 含义:术语所属的专业领域。用于在翻译时根据项目专业属性进行过滤。
- 数据类型:字符串,预定义枚举值或空值
- 必填:否(空值表示”通用”,适用于所有领域)
- 合法取值:
| 值 | 含义 | 典型术语示例 |
|---|---|---|
architecture |
建筑 | 女儿墙、防火门、采光井、外立面 |
mep |
暖通/给排水/电气 | 风管、冷凝水管、配电箱、桥架 |
structure |
结构 | 剪力墙、框架柱、基础底板、配筋 |
material |
材料 | C30混凝土、HRB400钢筋、SBS防水卷材 |
| (空值) | 通用(不限领域) | 标高、轴线、比例尺、图例 |
- 示例:
structure
领域过滤规则:如果某条术语的
domain字段为空(或未填),该术语在所有领域的翻译中都会生效。如果填写了具体领域(如structure),则该术语仅在结构专业的翻译任务中生效。这意味着您可以在不同领域的术语表中为同一个原文定义不同的译文——例如,”节点”在建筑领域译为node,在电气领域译为junction。
(6)priority — 优先级
- 含义:术语的优先等级,以数值表示。在同一原文命中多条术语时,优先级高的条目胜出。
- 数据类型:整数或小数
- 必填:否(默认值为 0)
- 取值范围:任意数值,数值越大优先级越高
- 示例:
10、5、0、-1
优先级冲突处理:假设术语表 A 和术语表 B 都包含原文
钢筋混凝土的条目,A 中的译文为Reinforced Concrete(priority=5),B 中的译文为RC(priority=10)。在翻译时系统会选择 priority=10 的条目RC作为译文。
常用约定:
100:强制性术语(如合同/规范要求的固定译法),不可被任何其他条目覆盖50:项目级权威术语(由项目技术负责人审定)10:推荐术语0(默认):普通术语-1:备选术语(仅在没有其他匹配时使用)
(7)do_not_translate — 不翻译标记
- 含义:标记该原文是否需要翻译。设置为
true表示跳过翻译,原文原样保留。 - 数据类型:布尔值(字符串形式)
- 必填:否(默认值为
false) - 合法取值:
true或false - 示例:
true
典型使用场景:
- 图号:如
J-01、结施-03(图号通常不翻译)- 编号/代号:如
A-1、C-15、PD-01- 公司名称:如设计单位的中文全称(有时合同中要求不翻译)
- 专有名词:如项目名称”上海中心大厦”(某些海外项目中,中文项目名要求保留不译)
- 公式/变量名:如
As(钢筋面积)、fc(混凝土抗压强度)
效果:当一个原文命中
do_not_translate=true的术语条目时,翻译引擎直接跳过该原文,在译文中保持原文不变。在翻译工作台中,该译文的来源标签会显示为灰色”术语表标记不译“。
(8)notes — 备注
- 含义:自由文本备注,用于记录该术语条目的说明信息。
- 数据类型:文本字符串
- 必填:否
- 格式要求:如果备注中包含逗号,需要用双引号包裹。
- 典型用法:
- 说明术语的来源(如”引自 GB 50010-2010”)
- 记录选择该译文的理由(如”业主指定的译法”)
- 标注审核状态(如”已审核-张三-2024-03”)
- 提供上下文说明(如”仅用于结构配筋图,建筑图中使用另一译法”)
6.5.2 完整示例
以下是一个标准的术语表 CSV 文件内容示例(用表格形式展示):
| source_text | target_text | source_language | target_language | domain | priority | do_not_translate | notes |
|---|---|---|---|---|---|---|---|
| 混凝土强度等级 | Concrete Strength Grade | zh-CN | en-US | structure | 100 | false | 引自 GB 50010-2010 |
| 钢筋保护层厚度 | Concrete Cover Thickness | zh-CN | en-US | structure | 100 | false | 标准术语 |
| 女儿墙 | Parapet Wall | zh-CN | en-US | architecture | 50 | false | 不可用 daughter wall |
| 风管 | Air Duct | zh-CN | en-US | mep | 50 | false | HVAC标准术语 |
| 结施-01 | zh-CN | en-US | 100 | true | 图号,不翻译 | ||
| C30 | C30 | zh-CN | en-US | material | 20 | false | 混凝土标号,不翻译数字部分 |
| 配电箱 | Distribution Box | zh-CN | en-US | mep | 50 | false | |
| 标高 | Elevation | zh-CN | en-US | 10 | false | 通用术语 |
对应的 CSV 文件原始内容(用文本形式展示,UTF-8 编码):
source_text,target_text,source_language,target_language,domain,priority,do_not_translate,notes
混凝土强度等级,Concrete Strength Grade,zh-CN,en-US,structure,100,false,引自 GB 50010-2010
钢筋保护层厚度,Concrete Cover Thickness,zh-CN,en-US,structure,100,false,标准术语
女儿墙,Parapet Wall,zh-CN,en-US,architecture,50,false,不可用 daughter wall
风管,Air Duct,zh-CN,en-US,mep,50,false,HVAC标准术语
结施-01,,zh-CN,en-US,,100,true,图号,不翻译
C30,C30,zh-CN,en-US,material,20,false,混凝土标号
配电箱,Distribution Box,zh-CN,en-US,mep,50,false,
标高,Elevation,zh-CN,en-US,,10,false,通用术语
6.5.3 注意事项
(1)编码格式
CSV 文件必须使用 UTF-8 编码 保存。如果使用 GBK 或 ANSI 编码,中文在预览和匹配时可能出现乱码或匹配失败。
检查方法:在 Excel 中打开 CSV 文件,点击”文件 → 另存为”,查看”编码”或”工具 → Web 选项 → 编码”中的当前编码设置。确保选择”UTF-8”。
修复方法:如果已有术语表是 GBK 编码,在 Excel 中打开后,点击”另存为”,在文件类型中选择”CSV UTF-8(逗号分隔)”,覆盖保存即可。
(2)逗号与引号处理
由于 CSV 以逗号(,)作为列分隔符,如果字段内容中本身包含逗号,必须用英文双引号(")包裹该字段。例如:
source_text,target_text,source_language,target_language,domain,priority,do_not_translate,notes
"钢筋,包括主筋与箍筋","Reinforcement, including main bars and stirrups",zh-CN,en-US,structure,100,false,
同理,如果字段内容中本身包含双引号,需要用两个双引号("")表示一个双引号字符。
(3)空值与必填字段
source_text、target_text(非不翻译场景)、source_language、target_language为实际意义上的必填字段,缺少时该条目无效。domain可以为空,表示”通用”。priority可以为空,默认为 0。do_not_translate可以为空,默认为false。notes可以为空。
(4)精确匹配的大小写与空白
术语匹配是精确字符串匹配,即原文与 source_text 必须完全一致(包括大小写、全半角空格、标点符号)才会命中。
| 图纸原文 | 术语表 source_text |
是否命中 |
|---|---|---|
C30混凝土 |
C30混凝土 |
✅ 命中 |
C30 混凝土 |
C30混凝土 |
❌ 不命中(多了空格) |
c30混凝土 |
C30混凝土 |
❌ 不命中(大小写不同) |
C30混凝土 |
C30混凝土 |
❌ 不命中(全角数字 vs 半角数字) |
(5)domain 字段的合法值
domain 字段的取值必须严格使用以下四个值之一(或空值):architecture、mep、structure、material。使用其他值(如 civil、architectural、大写 MEP)可能会导致该条术语不被任何项目匹配。
6.6 创建术语表实操指南
6.6.1 通过同文新建术语表
这是最推荐的创建方式,因为同文会自动生成正确格式的表头。
步骤:
- 打开同文 Studio,进入术语库页面。
- 点击左侧面板顶部的 ➕ 新建术语表 按钮。
- 系统自动创建 CSV 文件并调用 Excel 打开。您将看到一个包含表头行(8列列名)的空白表格。
- 逐行填写术语条目数据(每一项占一行)。
- 填写完毕后,按
Ctrl+S保存。 - 关闭 Excel。
- 回到同文术语库页面,新术语表已出现在左侧文件列表中。
- (可选)在术语表目录中重命名文件,使其名称具有辨识度。
6.6.2 在 Excel 中编辑的规范
当您通过同文打开术语表(使用”用 Excel 打开”按钮)或在外部直接用 Excel 编辑术语表 CSV 文件时,请遵循以下规范:
(1)不要修改表头行
第一行是固定的列名(source_text,target_text,source_language,target_language,domain,priority,do_not_translate,notes),请勿修改、删除或移动这些列名。修改列名会导致系统无法正确解析文件。
(2)不要在 Excel 中修改列顺序
CSV 解析依赖列的位置来确定字段含义。如果您在 Excel 中拖拽移动了列的位置(如将 domain 移到第一列),保存后系统将错误地将 domain 的值解读为 source_text。
(3)保存时选择正确的 CSV 格式
Excel 提供两种 CSV 保存格式:
| 保存格式 | 编码 | 推荐度 |
|---|---|---|
| CSV UTF-8(逗号分隔)(*.csv) | UTF-8 | ⭐ 强烈推荐 |
| CSV(逗号分隔)(*.csv) | 系统默认编码(可能是 GBK) | ❌ 不推荐(中文可能乱码) |
在”另存为”对话框中务必选择”CSV UTF-8(逗号分隔)”。如果您使用的是较早版本的 Excel 可能没有这个选项,此时建议使用其他支持 UTF-8 的文本编辑器(如 VS Code、Notepad++)来编辑 CSV 文件。
警告:当您在 Excel 中直接按
Ctrl+S保存 CSV 文件时,Excel 通常以系统默认编码(中文 Windows 下为 GBK)保存,而非 UTF-8。这会导致中文在重新导入时出现乱码。建议的做法是:在 Excel 中编辑完毕后,使用”另存为”功能,选择”CSV UTF-8(逗号分隔)”格式保存。
(4)不要合并单元格
Excel 的合并单元格功能在 CSV 格式中无法表达。如果您的术语表中包含合并的单元格,保存为 CSV 后数据可能错位。
(5)不要在同文打开时在 Excel 中删除文件
如果术语表文件正在同文中被预览,同时又通过 Excel 或资源管理器删除该文件,可能导致同文显示异常。如需删除术语表,建议先关闭同文对该表的预览,再通过资源管理器删除。
6.6.3 手动创建 CSV 文件
如果您更习惯使用纯文本编辑器,也可以手动创建 CSV 术语表:
- 打开记事本(Notepad)或 VS Code。
- 第一行输入表头:
source_text,target_text,source_language,target_language,domain,priority,do_not_translate,notes - 从第二行开始,每行一条术语,各字段用英文逗号分隔。
- 文件保存时,编码选择 UTF-8。
- 将文件扩展名设置为
.csv(如”我的术语表.csv”)。 - 将文件放入同文的术语表目录中(可通过”打开文件夹”按钮找到该目录)。
- 回到同文术语库页面,点击🔄刷新,新文件即出现在列表中。
6.7 术语表内容预览与编辑
6.7.1 刷新预览
适用时机:当您在 Excel 中修改了术语表内容并保存后,右侧预览面板不会自动更新,需要手动刷新。
操作步骤:
- 确保左侧文件列表中已选中要刷新的术语表。
- 点击右侧面板顶部的 🔄 刷新预览 按钮。
- 系统重新从磁盘读取术语表文件,右侧数据表格更新为最新内容。
快速判断是否需要刷新:如果右侧表格的底部统计栏显示的条目数与您预期的不一致,或新添加的术语尚未出现,请点击刷新预览。
6.7.2 用 Excel 打开编辑
这是最常用的编辑方式,适合进行批量增删改操作。
操作步骤:
- 在左侧文件列表中单击选中要编辑的术语表。
- 点击右侧面板顶部的 📊 用 Excel 打开 按钮。
- 系统启动 Excel 并加载该术语表文件。
- 在 Excel 中进行所需的编辑操作(添加行、修改译文、调整优先级等)。
- 编辑完成后,点击”文件 → 另存为”,选择”CSV UTF-8(逗号分隔)“格式保存。如果出现”是否替换已有文件”的提示,选择”是”。
- 关闭 Excel。
- 回到同文术语库页面,点击右侧的 🔄 刷新预览 查看更新后的内容。
编辑提示:
- 新增术语:在表格最后一行下方新建一行,逐列填入数据。
- 修改译文:直接修改对应单元格的内容。
- 删除术语:选中整行,右键 → 删除行。
- 调整优先级:直接修改
priority列的数值。- 不建议在 Excel 中对数据进行排序:排序后表头行可能混入数据区,导致解析错误。
6.7.3 打开文件夹
适用场景:需要直接管理术语表文件(如批量重命名、复制到其他项目、删除过时的术语表等)。
操作步骤:
- 点击右侧面板顶部的 📂 打开文件夹 按钮。
- Windows 资源管理器自动打开术语表文件所在的目录。
- 在资源管理器中进行所需的文件操作。
- 操作完成后,回到同文,点击左侧面板的 🔄 刷新 按钮以同步文件列表。
6.7.4 标记/取消全局
功能说明:”全局术语表”是指该术语表在所有项目(而非仅特定项目)中自动生效。标记为全局后,无需在单个项目的设置中手动引用该术语表。
操作步骤:
- 在左侧文件列表中选中要标记的术语表。
- 点击右侧面板顶部的 ⭐ 标记/取消全局 按钮。
- 如果当前术语表尚未标记为全局,点击后变为全局(图标状态变为实心星 ⭐)。
- 如果当前术语表已标记为全局,点击后取消全局(图标恢复为空心星 ☆)。
- 全局术语表在文件列表中可能有特殊的视觉标识(如文件名旁边带有星形标记)。
全局术语表 vs 项目术语表的详细说明:见 6.8 节。
6.7.5 8 列数据表浏览
右侧预览面板中的数据表以只读表格形式展示术语表内容。表格支持以下交互:
- 垂直滚动:使用鼠标滚轮或滚动条浏览所有术语条目。
- 水平滚动:当列宽不足以显示完整内容时,使用底部水平滚动条查看隐藏列。
- 列宽调整:部分版本可能支持拖拽列标题之间的分隔线来调整列宽。
仅预览,不可编辑:数据表格为只读预览模式。如需修改内容,请点击”用 Excel 打开”按钮进行编辑。
6.7.6 底部统计信息
右侧面板底部显示当前术语库的统计数据,帮助用户快速了解术语表规模:
共 3 个术语表 · 156 条术语
- 第一个数字(N 个术语表):左侧文件列表中术语表文件的总数。
- 第二个数字(M 条术语):当前选中术语表中的术语条目总数(包含表头行不计入)。
当您在左侧文件列表中切换选中不同的术语表时,第二个数字会随之更新以反映当前表的条目数。如果未选中任何术语表,第二个数字显示为 0。
6.8 全局术语表 vs 项目术语表
同文将术语表分为两个作用范围,以兼顾”组织级知识沉淀”与”项目级灵活定制”两方面的需求。
6.8.1 全局术语表
定义:全局术语表是被标记为”全局可用”的术语表文件。它在所有翻译项目中自动生效,无需在每个项目中单独配置。
适用场景:
- 组织级标准术语:设计院或翻译公司内部统一制定的术语规范,应用于所有项目。例如,”钢筋混凝土”在所有项目中统一译为
Reinforced Concrete。 - 行业通用术语:不随具体项目变化的通用工程术语。例如,”标高 → Elevation”、”轴线 → Grid Line”。
- 语言对基础术语:公司决定所有中译英翻译都必须遵守的基础术语集。
典型做法:
在建制化的团体中,通常由技术负责人维护一套或多套全局术语表,作为”组织知识资产”:
全局术语表/
├── 基础通用术语表.csv (全局)
├── 结构专业标准术语表.csv (全局,domain=structure)
├── 建筑专业标准术语表.csv (全局,domain=architecture)
├── MEP专业标准术语表.csv (全局,domain=mep)
└── 图号与代号不译表.csv (全局,do_not_translate=true)
6.8.2 项目术语表
定义:项目术语表是仅在特定项目中才生效的术语表。在项目设置中,用户可以为每个翻译项目单独指定引用哪些术语表文件。
适用场景:
- 项目专有术语:某个特定项目的特殊术语。例如,”XX大厦”在该项目中译为
XX Tower,但这个译法不适用于其他项目。 - 业主指定译法:海外业主或监理在合同中明确要求某些术语必须使用特定译法,这些译法可能与其他项目的习惯不同。
- 试验性术语:团队在探索更优译法时,先在单个项目中试用,验证效果后再决定是否纳入全局。
- 第三方术语表:翻译外包时,外包团队提供的术语表仅在本次外包项目中引用。
配置方式(在项目设置中操作,本节简述):
- 在 Studio 中打开目标项目,进入项目设置页面。
- 找到”术语表引用”配置区域。
- 从可用术语表列表中选择该项目需要使用的术语表,将其添加到引用列表。
- 保存项目设置。
6.8.3 使用场景对比
| 维度 | 全局术语表 | 项目术语表 |
|---|---|---|
| 作用范围 | 所有项目 | 仅指定项目 |
| 维护责任 | 通常由技术负责人/术语管理员统一维护 | 由项目经理或项目翻译负责人维护 |
| 变更影响 | 变更影响所有项目,需谨慎 | 变更仅影响当前项目,风险可控 |
| 典型内容 | 行业通用术语、公司标准术语 | 项目专有名称、业主指定译法 |
| 推荐数量 | 少而精(3~5套核心表) | 按需创建(每个项目可能需要1~3套) |
| 生命周期 | 长期积累,持续更新 | 随项目结束而归档 |
最佳实践:全局术语表应保持”少而精”——只包含经过充分论证、广泛适用的权威术语。项目术语表则灵活得多,可以快速响应当前项目的特殊需求。如果某个项目术语表中的术语被证明具有普遍适用性,可以将其”升级”到全局术语表。
6.9 翻译记忆(TM)介绍与工作原理
6.9.1 什么是翻译记忆
翻译记忆(Translation Memory,简称 TM)是翻译行业中广泛应用的生产力工具。其核心思想是:已翻译过的内容,不应该再翻译第二遍。
在同文中,每次翻译任务完成后,凡是经过审批通过的译文,都会自动存入翻译记忆库(TM 是一个 JSON 格式的文件)。当后续的翻译任务中遇到相同的原文时,系统直接从 TM 中调取已验证的译文,既保证了译文的一致性,又避免了重复翻译。
6.9.2 工作原理
TM 的工作流程可以用”积累 → 匹配 → 复用”三步来概括:
第一步:积累
翻译任务 → LLM/术语表生成译文 → 人工审校 → 审批通过 → 存入 TM
并非所有译文都会进入 TM。只有经过人工审批通过的译文才有资格存入 TM。这一机制确保了 TM 中存储的都是经过人工验证的高质量译文,不会被低质量的机器翻译污染。
第二步:匹配
当新的翻译任务到来时,系统对每一条原文执行以下流程:
- 在 TM 中查找是否存在相同原文的已审批译文。
- 匹配为精确匹配(原文必须完全相同)。
- 如果命中,提取对应的译文作为候选。
第三步:复用
命中的 TM 译文会自动作为翻译结果输出,并在翻译工作台中显示来源标签为青色”翻译记忆精确匹配“。人工审校时可以确认接受或在此基础上微调。
6.9.3 TM 与术语表的区别
TM 和术语表虽然都是翻译知识源,但定位和机制不同:
| 维度 | 术语表(Glossary) | 翻译记忆(TM) |
|---|---|---|
| 粒度 | 单词/短语级的术语 | 任意长度的句子/段落 |
| 创建方式 | 人工预先编制 | 翻译过程中自动积累 |
| 维护方式 | 人工增删改 | 系统自动管理(审批通过即入库) |
| 匹配方式 | 精确字符串匹配 | 精确字符串匹配 |
| 目的 | 约束术语译法,保证专业准确性 | 避免重复翻译,提高效率 |
| 典型内容 | “混凝土强度等级 → Concrete Strength Grade” | “本工程基础采用桩筏基础,桩径800mm。” → “The foundation of this project adopts a piled raft foundation with a pile diameter of 800mm.” |
| 来源标签颜色 | 紫色 | 青色 |
一句话总结:术语表是”字典”,规范单个词或短语的译法;翻译记忆是”经验库”,存储已验证的句子级译文以便复用。
6.10 人工修正记忆(CM)介绍与工作原理
6.10.1 什么是人工修正记忆
人工修正记忆(Correction Memory,简称 CM)是同文翻译知识体系中的”最高权威层”。它记录的是用户在翻译工作台中对机器译文或术语表译文进行手动修改后的最终译文。
与 TM 不同,CM 捕获的是用户在译文上的个性化修正——即用户认为系统给出的译文不够理想,亲自动手改了之后的版本。这个版本被视为”经人工认定的最优译文”。
6.10.2 工作原理
CM 的工作流程围绕”手动修改”这一核心行为展开:
第一步:触发修正
在翻译工作台中,用户对某条译文的原始输出(可能来自 LLM、术语表或 TM)不满意,手动修改译文内容。
第二步:记录修正
系统检测到用户进行了手动修改,将”原文 + 最终修改后的译文”作为一条 CM 记录存储在 CM 文件中(JSON 格式)。CM 记录会自动标记时间戳和修改人信息(如适用)。
第三步:优先匹配
当后续翻译任务中遇到相同的原文时,系统会优先查询 CM:
- 在 CM 中查找是否存在相同原文的修正记录。
- 如果命中,直接采用 CM 中存储的”人工修正后译文”。
- 翻译工作台中,该译文的来源标签显示为橙色”校正记忆精确匹配“。
关键特性:
- CM 的优先级高于 TM、术语表和 LLM,这是整个翻译知识体系中的最高优先级。
- CM 记录是用户行为的自动沉淀,不需要额外操作——用户只需正常审校和修改译文,系统自动记录修正。
- CM 是个人化的(通常存储于用户个人配置目录),反映的是特定用户的翻译偏好和修正习惯。
6.10.3 CM 与 TM 的区别
| 维度 | 翻译记忆(TM) | 人工修正记忆(CM) |
|---|---|---|
| 记录内容 | 审批通过的译文(可能来自术语表匹配或 LLM 翻译后审批) | 用户手动修改后的译文 |
| 触发条件 | 译文被审批通过 | 用户对译文进行了手动修改 |
| 权威性 | 高(经过人工审批验证) | 最高(经人工修改,视为最优) |
| 优先级 | 高于术语表,低于 CM | 最高(高于 TM、术语表、LLM) |
| 来源标签颜色 | 青色 | 橙色 |
| 典型场景 | “上次这整段文字审批通过了,这次直接复用” | “上次我觉得机器翻得不好,手动改成了这个版本,这次必须用改后的版本” |
类比理解:如果把翻译比作做菜,术语表是”标准菜谱”(确定每个食材叫什么),TM 是”做过的菜式记录”(上次这样做通过了),CM 是”主厨的调味笔记”(上次我专门调了味,这次必须按我调的来)。
6.11 四种翻译来源的优先级机制详解
这是同文翻译知识系统最核心的设计——四种翻译来源按优先级从高到低排列,保证最优译文始终被优先采用。
6.11.1 四层知识体系总览
┌────────────────────────────────────────────┐
│ 翻译请求:原文 │
├────────────────────────────────────────────┤
│ ① CM (校正记忆) 精度最高,人工修正 │ ← 第1层
│ ↓ 未命中 │
│ ② TM (翻译记忆) 审批通过的积累 │ ← 第2层
│ ↓ 未命中 │
│ ③ Glossary (术语表) 用户预设的术语 │ ← 第3层
│ ↓ 未命中 │
│ ④ LLM (大语言模型) 通用翻译引擎 │ ← 第4层(兜底)
└────────────────────────────────────────────┘
每一层的匹配都是精确字符串匹配。一旦某一层命中,立即返回结果,不再查询更低的层。只有当前层未命中时,才会继续查询下一层。
6.11.2 优先级规则详解
规则:CM > TM > Glossary > LLM
| 序号 | 知识层 | 匹配条件 | 命中后行为 | 未命中时 |
|---|---|---|---|---|
| 1 | CM | 原文与 CM 记录中的原文完全相同 | 直接采用 CM 译文,不再查询后续层 | 继续查询 TM |
| 2 | TM | 原文与 TM 记录中的原文完全相同 | 直接采用 TM 译文,不再查询后续层 | 继续查询 Glossary |
| 3 | Glossary | 原文与术语表中的 source_text 完全相同 |
直接采用术语表译文;若 do_not_translate=true 则保留原文不译 |
继续查询 LLM |
| 4 | LLM | (无匹配条件,兜底层) | 调用大语言模型生成译文 | 无(LLM 始终能生成译文) |
举例说明:
假设原文为”钢筋混凝土”,系统中存在以下记录:
- CM 中记录:
钢筋混凝土 → Reinforced Concrete (RC) - TM 中记录:
钢筋混凝土 → Reinforced Concrete - 术语表中记录:
钢筋混凝土 → RC Structure
查询过程:
- 查询 CM → 命中 → 译文为
Reinforced Concrete (RC),来源标签为橙色”校正记忆精确匹配”。 - TM 和术语表不会被查询。
如果 CM 中没有”钢筋混凝土”的记录:
- 查询 CM → 未命中。
- 查询 TM → 命中 → 译文为
Reinforced Concrete,来源标签为青色”翻译记忆精确匹配”。
6.11.3 来源标签颜色与含义
在翻译工作台中,每条译文的来源会以彩色标签形式直观标注,方便用户识别该译文的知识来源并进行针对性审校:
| 标签颜色 | 标签文字 | 知识来源 | 审校建议 |
|---|---|---|---|
| 🟠 橙色 | 校正记忆精确匹配 | CM | 最高信任度——这是您(或同事)之前手动修改确认过的译文,一般无需再次修改。 |
| 🔵 青色 | 翻译记忆精确匹配 | TM | 高信任度——这是之前审批通过的译文,建议快速浏览确认上下文适用性。 |
| 🟣 紫色 | 术语表精确匹配 | Glossary | 中高信任度——这是您预设的术语标准译法,但可能在特定语境下需要微调。 |
| ⚪ 灰色 | 术语表标记不译 | Glossary(do_not_translate=true) | 确认该原文确实不需要翻译(如图号、编号等)。 |
| ⬜ 默认色 | (无标签或AI翻译) | LLM | 最低信任度——这是机器生成的译文,必须仔细审校。 |
6.11.4 实际匹配流程(完整示例)
假设用户正在进行一个结构专业的中译英翻译任务,原文为”基础底板厚度 500mm”。系统执行以下完整匹配流程:
Step 1: CM 查询
└ 查询原文:"基础底板厚度 500mm"
└ 结果:CM 中无此记录 → 未命中
Step 2: TM 查询
└ 查询原文:"基础底板厚度 500mm"
└ 结果:TM 中无此记录 → 未命中
Step 3: Glossary 查询(逐条匹配)
└ 先查"基础底板厚度 500mm"整体 → 术语表中无此完整短语
└ 再查子串"基础底板厚度" → 命中术语表条目
- source_text: "基础底板厚度"
- target_text: "Base Slab Thickness"
- do_not_translate: false
└ 结果:命中!译文中的"基础底板厚度"部分被替换为 "Base Slab Thickness"
但"500mm"部分未被术语表覆盖
Step 4: LLM 翻译(处理未覆盖部分)
└ 未被术语表覆盖的部分("500mm"、整体句子结构)由LLM处理
└ 最终译文:"Base Slab Thickness: 500mm"
来源标签:部分术语表精确匹配(紫色)
注意:术语表的匹配是”词/短语级”的,而非”整句级”的。在上面的例子中,术语表覆盖了”基础底板厚度”这个短语,但整个句子并非完全由术语表驱动。因此翻译工作台中该译文的来源标签可能是混合标识——核心术语来自术语表,句式和其他内容由 LLM 生成。
6.12 术语表如何影响翻译结果
术语表不是简单的”替换字典”,它通过多个字段的组合逻辑精细地控制翻译行为。
6.12.1 精确匹配机制
术语表对翻译结果的影响基于精确匹配算法:
- 系统将原文与术语表中所有
source_text进行精确比对。 - 命中的条件:原文字符串与
source_text完全一致(含大小写、空格、标点)。 - 命中的后果:该部分原文在翻译时被替换为
target_text的值。
长短匹配的优先规则:如果术语表中同时存在”基础”→
Foundation和”基础底板”→Base Slab两条术语,原文”基础底板”中的”基础”部分会被匹配为哪个?系统优先采用最长匹配——即”基础底板”整体命中,而非将”基础”单独匹配。这避免了短术语截断长术语的问题。
6.12.2 do_not_translate 标记
当术语条目中的 do_not_translate 字段为 true 时:
- 翻译引擎跳过该原文的翻译,译文直接等于原文。
- 在翻译工作台中,来源标签显示为灰色”术语表标记不译“。
- 该原文仍然会被提取到翻译工作台中(不会消失),只是译文等于原文,审校人员可以确认或手动修改。
典型条目示例:
| source_text | target_text | do_not_translate | 翻译结果 |
|---|---|---|---|
| 结施-05 | (留空) | true | 译文 = 结施-05(不翻译) |
| HD-03 | (留空) | true | 译文 = HD-03(不翻译) |
| As | (留空) | true | 译文 = As(不翻译,钢筋面积符号) |
6.12.3 priority 优先级
priority 字段解决”同一原文,多个术语表条目”的冲突问题:
- 当多个术语条目具有相同的
source_text时,系统选择priority值最大的条目。 - 如果两条目的
priority相同,系统选择先加载的术语表中的条目(加载顺序通常与术语表在文件列表中的顺序有关)。
示例:
术语表 A(项目术语表):
source_text: 钢筋混凝土
target_text: RC
priority: 50
术语表 B(全局术语表):
source_text: 钢筋混凝土
target_text: Reinforced Concrete
priority: 100
结果:priority=100 > 50,译文采用 Reinforced Concrete(来自全局术语表 B)。这体现了”全局权威术语优先”的设计理念。
实战建议:为重要的、权威的术语设置较高的
priority值(如 100),为可选的、推荐性的术语设置较低的priority(如 10)。这样可以在引入第三方术语表时,防止低质量的术语覆盖您精心维护的核心术语。
6.12.4 domain 领域过滤
domain 字段通过”专业隔离”机制,允许同一原文在不同专业领域拥有不同的标准译文:
- 项目设置中会指定当前项目的专业领域。
- 术语匹配时,系统优先使用
domain与项目领域一致的术语条目。 domain为空的通用条目在所有项目中均生效。
示例:
原文:”节点”
| domain | target_text | 适用场景 |
|---|---|---|
structure |
Joint | 结构专业项目翻译为 Joint |
mep |
Junction | MEP 专业项目翻译为 Junction |
architecture |
Node | 建筑专业项目翻译为 Node |
| (空) | Connection Point | 通用(如果项目领域不是上述三者,则使用通用译文) |
当一个术语表中同一原文有多条不同 domain 的条目时:
- 如果项目领域与某条目的
domain完全匹配 → 优先采用该条目。 - 如果没有任何条目的
domain与项目领域匹配 → 采用domain为空的通用条目。 - 如果既没有领域匹配条目,也没有通用条目 → 该原文不在术语表中命中,交给 LLM 翻译。
6.13 术语管理最佳实践
一个经过良好维护的术语库是同文翻译系统的”核心资产”,其质量直接决定了翻译一致性的上限。以下是根据实际使用经验总结的管理建议。
6.13.1 术语表的组织方式
(1)按专业领域分表
不要把所有术语塞进一个巨大的 CSV 文件。推荐按专业领域拆分为多个术语表:
术语表目录/
├── 00-通用术语表.csv # 不含domain,所有项目生效(全局)
├── 01-建筑专业术语表.csv # domain=architecture(全局)
├── 02-结构专业术语表.csv # domain=structure(全局)
├── 03-MEP专业术语表.csv # domain=mep(全局)
├── 04-材料专业术语表.csv # domain=material(全局)
├── 05-图号与代号不译表.csv # do_not_translate=true为主
└── 项目_XX大厦_业主指定术语.csv # 项目专有术语(非全局)
优势:
- 维护时只需打开相关专业的表,不会被其他专业条目干扰。
- 项目引用时可以精确选择需要的专业术语表。
- 分工明确:结构工程师维护结构术语表,暖通工程师维护 MEP 术语表。
(2)按语言对分表
如果贵公司有多个目标语言的翻译需求,建议进一步按语言对分表:
术语表目录/
├── zh-en/
│ ├── 建筑专业术语表_zh-en.csv
│ ├── 结构专业术语表_zh-en.csv
│ └── ...
├── zh-ja/
│ ├── 建筑专业术语表_zh-ja.csv
│ └── ...
└── zh-ar/
└── ...
(3)文件命名规范
推荐的命名规范(供参考):
[序号]-[专业领域]-[语言对]-[版本].csv
示例:
01-结构-zh-en-v2.3.csv02-MEP-zh-ja-v1.0.csv
6.13.2 术语条目的编写规范
(1)原文(source_text)
- 严格依据图纸中的实际写法,包括标点符号和空格。
- 不要添加额外的修饰性文字(如”指”、”即”等),保持原文原样。
- 对于图纸中可能出现的多种变体(如”预应力混凝土”和”预应力砼”),分别建立独立的术语条目。不要假设系统会自动关联两种写法。
- 大小写敏感——如果图纸中是
C30,术语表中的source_text必须是C30,而不是c30。
(2)译文(target_text)
- 优先采用国家标准、行业规范中的标准译法。
- 当没有标准译法时,查阅权威工程词典或参考同行惯例。
- 译文首字母大写规则保持一致(英文中标题式写法通常每个实词首字母大写)。
- 如果译文与原文在形式上需要保持一致(如原文是”第X层”,译文建议为”Level X”而非”X Floor”),在
notes中记录下来,方便查阅。
(3)优先级(priority)的约定
在团队中建立统一的优先级数值约定(示例):
| priority | 约定含义 | 使用场景 |
|---|---|---|
| 100 | 强制术语 | 国家标准、行业规范、合同要求、法律法规中明确定义的术语 |
| 80 | 公司强制术语 | 设计院内部统一规定、企业标准 |
| 50 | 推荐术语 | 经过团队讨论确定的优选译法 |
| 30 | 项目术语 | 某项目特定的译法约定 |
| 10 | 普通术语 | 一般性术语,无特殊要求 |
| 0 | 默认 | 未指定优先级 |
| -1 | 弃用术语 | 曾经使用但已被新译法替换,保留以兼容旧项目 |
6.13.3 定期维护与更新
术语库不是”一次性建设”的产物,而是需要持续维护的活体知识库:
(1)版本管理
- 为术语表文件添加版本号(在文件名或备注中)。
- 每次重大更新后保存历史版本备份。
- 如有条件,推荐使用 Git 等版本控制工具管理术语表 CSV 文件(CSV 是纯文本格式,Git 可以清晰追踪每次变更)。
(2)定期审查周期
| 审查内容 | 建议周期 | 审查重点 |
|---|---|---|
| 新增术语 | 每次翻译任务结束后 | 检查是否有新发现的专业术语需要入库 |
| 已有术语复核 | 每季度 | 检查译法是否仍然准确、是否有更优译法出现 |
| 全局术语表审计 | 每半年 | 清理重复条目、纠正常见错误、调整优先级 |
| 弃用术语清理 | 每年 | 将长期不再使用的术语标记为弃用或删除 |
(3)审核流程
对于全局术语表,建议设置基本的审核流程:
提出修改 → 专业负责人审核 → 通知团队 → 更新术语表 → 同步到所有项目
(4)清理重复条目
同一个术语在不同时期可能被多人重复添加到不同术语表中。定期使用 Excel 的”删除重复值”功能(数据 → 删除重复项,基于 source_text 列)清理重复条目,保留 priority 最高的那条。
6.13.4 团队协作中的术语管理
在多人协作使用同文的环境中,术语管理需要额外的协调机制:
(1)指定术语负责人
由一位对专业术语有深厚积累的工程师(通常是技术负责人或资深设计师)担任术语负责人,对全局术语表的质量负责。
(2)术语表共享
- 将全局术语表放在共享目录(如公司文件服务器或共享网盘)中,所有团队成员指向同一目录。
- 或者使用 Git 仓库管理术语表,成员通过 pull/push 同步。
- 确保所有终端用户的同文 Studio 术语表目录路径配置一致。
(3)术语变更通知
当全局术语表发生变更(尤其是已有术语的译文被修改)时,务必通知所有团队成员。否则已完成的翻译中可能仍使用旧译法,造成新旧版本译文并存的不一致。
(4)项目术语表的归档与复用
项目结束后,不要丢弃项目术语表。建议做法:
- 归档到”已完成项目术语表”目录。
- 在其中筛选有价值的新术语(即在项目中发现但全局术语表中没有的术语)。
- 将该术语补充到全局术语表中(经审核后)。
- 保留完整项目术语表作为项目交付物的一部分存档。
6.14 常见问题
术语表相关
Q1:为什么我在术语表中添加了某条术语,但翻译时没有生效?
排查步骤:
- 检查术语表中的
source_text是否与图纸原文完全一致(包括空格、大小写、全半角字符)。 - 检查术语表中的
source_language和target_language是否与当前翻译任务的语言设置匹配。 - 检查术语表的
domain字段是否与项目领域匹配(如果术语设置了特定领域,而项目领域不同,则不会生效)。 - 检查该术语的
do_not_translate是否为true(如果为 true,译文会被跳过,可能让您误以为术语表没有生效)。 - 确认术语表文件已经保存(尤其是在 Excel 中编辑后未保存)。
- 确认在项目设置中已经引用了该术语表(或已标记为全局)。
- 点击同文中的刷新预览,确认术语表内容已正确加载。
- 检查 CSV 文件的编码是否为 UTF-8(GBK 编码可能导致中文匹配失败)。
Q2:CSV 文件中的中文在预览时显示为乱码怎么办?
这是编码不匹配的典型表现。
解决方法:
- 在 Excel 中打开 CSV 文件。
- 点击”文件 → 另存为”。
- 在文件类型中选择”CSV UTF-8(逗号分隔)“。
- 覆盖原文件保存。
- 回到同文术语库页面,点击🔄刷新预览。
如果您的 Excel 版本没有”CSV UTF-8”选项,可以使用 Notepad++ 或 VS Code 打开 CSV 文件,将编码转换为 UTF-8 后保存。
Q3:同一个术语在多张术语表中都存在,系统如何选择?
系统通过两个规则处理冲突:
- 优先级优先:选择
priority值最大的条目。 - 全局优先于项目(当优先级相同时):全局术语表的条目优先于项目术语表的条目。
- 最长匹配优先(针对子串匹配):更长的原文匹配优先于较短的原文匹配。
Q4:我想让某个术语仅在结构专业中生效,在建筑专业中不生效,应该怎么配置?
在术语表中为该术语条目设置 domain 字段为 structure。然后在项目设置中将建筑项目的专业领域设置为 architecture(而非 structure)。这样在建筑项目中该术语不会被匹配到。
如果建筑项目中该原文需要另一个译法,可以在术语表中新增一条:
source_text: (同样的原文)
target_text: (建筑专业的译文)
domain: architecture
priority: (根据需要设置)
Q5:如何在 Excel 中批量修改术语表而不破坏格式?
- 先在同文中点击”用 Excel 打开”,确保表头完整。
- 在 Excel 中进行操作时:
- 不要使用”排序”功能:排序可能将表头行混入数据区。
- 不要插入或删除列:保持 8 列结构不变。
- 使用”筛选”而非”排序”来查找特定条目。
- 修改完成后,使用”另存为 → CSV UTF-8(逗号分隔)”保存。
- 保存时忽略 Excel 弹出的”此文件格式不支持某些功能”警告,点击”是”继续。
Q6:我有一份现成的 Excel 术语表(.xlsx 格式),如何快速转换成同文可用的 CSV?
- 在 Excel 中打开 .xlsx 文件。
- 确保数据结构符合同文的 8 列格式(可能需要调整列名和列顺序)。
- 点击”文件 → 另存为”。
- 选择保存类型为”CSV UTF-8(逗号分隔)(*.csv)“。
- 保存后,在同文术语库页面点击”导入 CSV”,选择生成的 .csv 文件即可。
翻译知识系统相关
Q7:翻译记忆(TM)和术语表(Glossary)都是匹配原文的,为什么 TM 的优先级比术语表高?
因为 TM 中存储的是经过审批通过的已验证译文,其质量经过了人工把关。而术语表中的术语译法虽然是预设的,但可能在特定上下文(完整的句子环境)中不够准确。TM 记录的是”上次这句话在相同语境下的最佳译文”,应该优先采用。
Q8:如果我修改了术语表中的某条译文,已经存入 TM 的旧译文会被自动更新吗?
不会。TM 中存储的是历史上审批通过时的译文快照,不会因为术语表修改而自动更新。如果您希望 TM 中的旧译文也被覆盖,通常有两种方式:
- 手动方式:在下一次翻译任务中,系统会先用 CM/TM 中的旧译文,您可以在审校时手动修改为新的术语译文,修改后该新译文会存入 CM。
- 重新审批:如果系统支持,清除 TM 中的相关记录,让系统重新通过术语表匹配生成译文,然后审批通过重新入库。
注意:这是一个设计上的权衡——TM 的稳定性(不改动历史记录)与术语表的可更新性之间的平衡。在实际使用中,术语表的变更通常是对个别术语的微调,通过 CM 机制可以在后续翻译中逐步覆盖旧的 TM 记录。
Q9:CM(校正记忆)可以跨项目共享吗?
CM 通常是用户个人级别的记录,存储在用户本地配置中。它反映了特定用户的翻译偏好。在团队协作场景中,CM 的共享取决于同文的具体实现:
- 如果团队使用共享的翻译记忆库,可能需要考虑将 CM 与 TM 合并管理。
- 通常情况下,高价值的 CM 条目应该被整理后纳入术语表或 TM 中,使其成为团队级的知识资产。
Q10:如何查看我的 CM 中有哪些记录?
CM(人工修正记忆)作为自动积累的背景知识,通常不需要用户手动查看或管理。如果您需要了解哪些译文是 CM 匹配的,可以在翻译工作台中查看来源标签——橙色的”校正记忆精确匹配”标签即为 CM 命中。
如需清理或导出 CM 记录,请查阅同文的高级设置或联系技术支持。
Q11:四种翻译知识层的优先级是否可以自定义调整?
不建议调整。CM > TM > Glossary > LLM 这个优先级顺序是经过产品设计验证的,改变顺序可能导致逻辑矛盾(如 LLM 的译文覆盖了人工修正的译文)。如果特殊情况需要自定义行为,可以通过以下方式间接实现:
- 想要术语表优先级高于 TM:提高术语表中相关条目的
priority值,同时在审校时手动修改 TM 的旧译文(从而将其存入 CM,CM 优先级最高)。 - 想要 LLM 优先于术语表:从项目中移除该术语表的引用。
6.15 本章小结
本章全面介绍了同文术语库与翻译知识系统的全部内容:
术语库(Glossary):
- 概念与定位:术语库是用户主动维护的专业术语”字典”,确保术语译法的一致性和准确性。在同文翻译知识体系中处于第三层优先级(高于 LLM,低于 TM 和 CM)。
- 页面布局:左侧为术语表文件列表(含刷新、导入CSV、新建、搜索功能),右侧为内容预览(含刷新预览、Excel打开、打开文件夹、全局标记及8列数据表格)。
- CSV 格式:8列标准格式——
source_text(原文)、target_text(译文)、source_language(源语言)、target_language(目标语言)、domain(领域)、priority(优先级)、do_not_translate(不翻译标记)、notes(备注)。每一列都有明确的含义和使用规范。 - 操作指南:新建术语表、导入外部 CSV、在 Excel 中编辑保存(务必使用 UTF-8 编码)、刷新预览、标记全局等完整操作流程。
- 全局 vs 项目:全局术语表在所有项目中自动生效,适合组织级标准术语;项目术语表仅当前项目生效,适合项目专有术语和业主指定译法。
翻译知识系统:
- 四层知识体系:CM(校正记忆)> TM(翻译记忆)> Glossary(术语表)> LLM(大语言模型),按优先级依次查询,优先采用高层知识。
- 翻译记忆(TM):审批通过的译文自动积累,来源标签为青色。解决”已翻译过的内容不再翻译第二遍”的效率问题。
- 人工修正记忆(CM):用户手动修改的译文自动记录,来源标签为橙色。优先级最高,确保人工修正的权威性。
- LLM 兜底:前三层知识均未命中时,由大语言模型生成译文,需人工审校。
- 术语工作机制:精确字符串匹配、
do_not_translate标记跳过翻译、priority解决多条目冲突、domain实现领域隔离。
最佳实践:
- 按专业领域和语言对组织术语表、建立文件命名规范、设置统一的优先级约定。
- 定期审查和更新术语表、建立审核流程、团队协作中指定术语负责人。
- 项目结束后筛选有价值的术语补充到全局术语表,实现知识资产的持续积累。
术语库和翻译知识系统是同文翻译质量保障的基石。一个精心维护的术语库可以显著降低人工审校的工作量,提升翻译的一致性和专业性。下一章将进入翻译工作的实操核心——翻译工作台操作指南,展示如何将术语库的知识真正应用到逐条翻译中。
下一篇:[第07章:翻译工作台操作指南](待更新) 上一篇:[第05章:项目与任务管理](待更新) 返回:同文教程目录