znlgis 博客

GIS开发与技术分享 — GDAL · GeoServer · PostGIS · QGIS · OpenLayers · Cesium · FreeCAD · NPOI

第04章:图纸文字提取

产品官网https://shandianweihu.com/


4.1 本章概述

在 CAD 图纸翻译工作中,最基础也最关键的环节便是将图纸中的文字”取出来”——只有把原文准确、完整地提取到翻译环境中,后续的翻译、校对、回写才有意义。

同文(Tongwen)的”图纸文字提取”功能正是为这一环节设计的。它能够从 DWG/DXF 图纸中自动识别和提取所有文字实体,将原文转化成可供翻译的结构化数据,同时保留文字的各项格式信息,为后续的翻译和回填奠定基础。

本章将从零开始,系统讲解文字提取的两种方式、每一步操作、提取过程中的状态变化、提取结果的解读,以及实际使用中的注意事项与最佳实践。

本章阅读建议:如果您是首次使用同文,建议从头到尾按顺序阅读;如果您已经熟悉基本操作,可以直接跳转到需要深入了解的章节。


4.2 文字提取概述

4.2.1 提取什么

同文的文字提取功能会从 DWG/DXF 图纸中识别并提取以下三种文字实体类型:

实体类型 全称 说明
DBText 单行文字 AutoCAD 中最基础的独立文字类型,通常用于标题、标注、简短注释。每一条 DBText 占据一个独立位置,内容不自动换行。
MText 多行文字 支持换行、字体切换、颜色变化、下划线等内嵌格式的多段落文字实体。通常用于技术说明、大段注释、材料表等需要丰富排版的场景。
AttributeReference 块属性文字 嵌入在 BlockReference(块参照)中的属性定义实例。最常见的是图框中的标题栏信息——项目名称、图号、日期、设计人等。这些文字属于块的一部分,不是独立的文字实体。

这三种实体基本覆盖了工程图纸中所有可能出现的文字形式。无论是标注、标题、技术说明还是图框信息,同文都能将其提取出来。

4.2.2 为什么需要提取

直接在 AutoCAD 中修改图纸文字看似简单,但在翻译场景下存在几个根本性问题:

  1. 文字分散:一张中型图纸可能包含数百甚至上千个文字实体,分布在数十个图层上,手动逐个查找和修改效率极低,且极易遗漏。
  2. 格式风险:MText 内部含有大量格式码(字体、颜色、字高等),直接在 AutoCAD 中修改容易破坏这些格式码,导致译后文字排版混乱。
  3. 图框文字的归属问题:图框中的文字属于块属性,普通编辑命令无法直接访问,需要特殊的属性编辑流程。
  4. 翻译记忆与一致性:同一张图纸或同一批图纸中经常出现相同的术语(如”混凝土强度等级”、”钢筋保护层厚度”),如果每条都重新翻译,不仅耗时,还无法保证术语的一致性。
  5. 协作需求:翻译工作通常由专业人员完成,他们不一定会使用 AutoCAD。将文字提取为独立的翻译会话文件,可以让翻译人员在独立的翻译工作台中进行工作,而不必接触 AutoCAD。

同文的提取功能将这些文字统一提取到翻译工作台中,配以翻译记忆、术语库等辅助工具,让翻译过程既高效又规范。

4.2.3 两种提取方式

同文提供两种文字提取入口,分别适应不同的工作场景:

提取方式 使用环境 适用场景
Studio 桌面端提取 同文 Studio(项目管理界面) 批量处理、任务管理、无需打开 AutoCAD
AutoCAD 插件端提取 AutoCAD 内嵌侧边面板 即时提取、框选区域、交互式操作

两种方式的底层提取逻辑是一致的,区别在于操作流程和使用场景。Studio 端适合项目化、批量化的翻译任务管理;插件端适合单张图纸的即时提取和精细的区域选择。


4.3 提取信息详解

在深入操作步骤之前,了解提取结果中包含哪些信息,有助于理解整个提取机制的设计意图。

同文对每个文字实体提取以下信息:

信息字段 说明
文本内容 文字的原始字符串内容。对于 MText,格式码会被占位符保护,不会丢失。
对象类型 标识该实体是 DBText、MText 还是 AttributeReference。
图层 文字所在的 AutoCAD 图层名称。在翻译工作台中可依据图层进行筛选和组织。
句柄(Handle) 实体在 DWG 文件中的唯一标识符,用于回写时精确定位目标实体。
位置坐标 文字在图纸空间或模型空间中的几何位置。
文本样式 文字使用的 AutoCAD 文字样式名称。
包围盒(Bounding Box) 文字占用的矩形区域范围,用于估计译文的可用空间。

这些信息在翻译工作台中都可以查看,辅助判断上下文。例如:通过图层名可以大致了解该文字属于哪个专业(建筑、结构、电气等);通过包围盒可以预估译文是否会超出预留空间。

4.3.1 提取结果保存格式

提取完成后,结果保存为一个翻译会话文件.tw 文件)。这个文件包含了当前图纸中所有文字实体的完整提取数据,是同文翻译工作台的核心数据格式。

.tw 文件的特点:

  • 自包含:所有提取信息都保存在这一个文件中,便于传递和备份。
  • 可增量更新:对同一张图纸多次提取时,新提取的内容会与已有会话智能合并。
  • 与 DWG 关联:文件记录了源 DWG 的关联信息,确保回写时目标正确。

4.4 Studio 端提取流程(详细步骤)

Studio 端提取通过项目管理页面发起,调用 AutoCAD Core Console 在后台完成提取。这种方式不需要打开 AutoCAD 图形界面,特别适合批量处理。

4.4.1 前置条件

在开始 Studio 端提取之前,请确保以下条件已满足:

  1. 已安装同文 Studio:Studio 是桌面端管理程序,负责项目管理、提取调度和翻译工作台的集成。
  2. 已安装 AutoCAD Core Console:Core Console(accoreconsole.exe)是 AutoCAD 的无界面命令行运行环境,负责加载图纸并执行提取操作。Core Console 需要与 Studio 安装在同一台计算机上。
  3. 已安装同文 AutoCAD 插件:插件需要被 Core Console 加载执行。即使您不通过 AutoCAD 图形界面使用插件,插件程序本身也必须安装。
  4. 待提取的 DWG/DXF 文件可访问:文件需要存放在 Studio 可以访问的路径中。

4.4.2 步骤一:进入项目管理页面

  1. 启动同文 Studio。
  2. 在左侧导航栏中,点击“项目管理”(或类似名称的入口)。
  3. 在项目管理页面中,您会看到已有的翻译任务列表(如果之前创建过)。每个任务对应一个翻译项目,可以包含多张图纸。

4.4.3 步骤二:新建翻译任务

  1. 点击“新建任务”按钮(通常位于页面顶部或右上角)。
  2. 在弹出的对话框中,填写任务基本信息:
    • 任务名称:为本次翻译任务命名,建议使用有意义的名称,如”XX项目施工图翻译”。
    • 源语言/目标语言:选择原文语言和目标翻译语言,例如”中文 → 英文”。
    • 备注(可选):可添加项目编号、负责人等信息。
  3. 点击“确定”创建任务。

新任务创建后会自动进入该任务的详情页面。

4.4.4 步骤三:添加图纸文件

  1. 在任务详情页面中,找到“添加图纸”“导入文件”按钮。
  2. 点击按钮,弹出文件选择对话框。
  3. 浏览到待翻译的 DWG 或 DXF 文件所在路径,选中文件(支持多选),点击“打开”
  4. 文件添加后,会在任务页面的文件列表中显示。每条记录显示文件名、文件路径、状态等信息。

4.4.5 步骤四:发起文字提取

  1. 在文件列表中,勾选需要提取文字的图纸文件(可多选)。
  2. 点击“提取文字”“开始提取”按钮。
  3. 此时 Studio 进入提取准备阶段:
    • Studio 生成一份提取脚本——这是一个自动化的指令序列,告诉 Core Console 加载哪张图纸、执行哪些操作、将结果发送到哪里。
    • Studio 启动内部的Sidecar/Pipe 服务——这是一个数据接收服务,等待 Core Console 发回提取结果。

4.4.6 步骤五:Core Console 提取过程

这一阶段是自动执行的,用户无需手动操作。以下描述的是后台的实际运行过程,了解这个过程有助于在出现问题时进行排查。

  1. 启动 Core Console:Studio 调用 accoreconsole.exe,传入生成好的提取脚本路径作为参数。
  2. 加载插件:Core Console 启动后,按照脚本指示加载同文的 AutoCAD 插件。
  3. 加载图纸:Core Console 打开指定的 DWG/DXF 文件。
  4. 执行提取:插件遍历图纸中的所有文字实体(DBText、MText、AttributeReference),收集每条文字的信息。
  5. 格式码保护:对于 MText 实体,插件自动识别内部的格式码(如字体切换 \f、颜色切换 \C、字高切换 \H、下划线 \L 等),并将其替换为占位符。这样在翻译工作台中看到的文字是干净的纯文本,而格式信息被保留,回写时可以恢复。
  6. 发送结果:提取完成后,插件通过 Named Pipe(命名管道) 将结果数据发送给 Studio 的 Sidecar/Pipe 服务。
  7. 接收数据:Sidecar/Pipe 服务接收数据,写入翻译会话文件(.tw),并与任务关联。
  8. Core Console 退出:数据发送完毕后,Core Console 自动关闭。

4.4.7 步骤六:观察提取进度

在提取过程中,Studio 界面会实时显示提取进度:

进度指示 说明
步骤文字 当前正在执行的步骤描述,如”正在加载图纸…“、”正在提取文字实体…“、”正在传输数据…“等。文字描述具体且动态变化,让您清楚知道当前处于哪个阶段。
耗时统计 从提取开始到当前时刻的累计耗时。通常一张常规图纸的提取在几秒到几十秒内完成。
终止按钮 进度条旁有一个“终止提取”按钮。如果提取卡住或您改变了主意,可以随时点击终止。终止操作会安全地关闭 Core Console 进程并清理临时数据。

4.4.8 步骤七:提取完成

提取成功后,界面会更新为完成状态:

  • 状态标识:任务列表中对应图纸的状态变为”已提取”或”可翻译”。
  • 实体数统计:界面会显示本次提取到的文字实体数量,如”共提取 247 个文字实体”,并按类型分别统计(如”DBText: 156, MText: 68, AttributeReference: 23”)。
  • 操作入口:出现“进入翻译工作台”“开始翻译”按钮,点击即可跳转到翻译工作台,开始正式的翻译工作。

4.5 AutoCAD 插件端提取流程(详细步骤)

插件端提取在 AutoCAD 内部操作,通过侧边面板发起,具有极强的交互性和即时性。适合以下场景:

  • 您已经在 AutoCAD 中打开了图纸,想立即提取文字进行翻译。
  • 您只需要翻译图纸中的某个区域(而非整张图纸)。
  • 您希望先看看提取结果,再决定是否创建正式任务。

4.5.1 前置条件

  1. 已安装同文 AutoCAD 插件:插件安装后,在 AutoCAD 中会出现同文的侧边面板或工具栏。
  2. 当前已打开待提取的 DWG 文件:插件端提取直接针对当前激活的文档。

4.5.2 打开侧边面板

  1. 在 AutoCAD 中,找到同文插件的入口。可能是以下形式之一:
    • 一个独立的侧边面板(类似属性面板或图层管理器的停靠窗口)。
    • Ribbon 工具栏中的一个按钮,点击后弹出面板。
    • 命令行输入特定命令打开面板(具体命令请参考同文插件文档)。
  2. 打开面板后,您会看到同文插件的主界面。面板通常包含以下区域:
    • 提取操作区(整图提取 / 框选提取按钮)
    • 提取选项区(如”不提取图框文字”勾选框)
    • 任务/会话信息区
    • 状态提示区

4.5.3 方式一:整图提取

“整图提取”是最常用的方式,用于提取当前图纸中所有文字实体。

操作步骤

  1. 确保您要提取的 DWG 文件是 AutoCAD 当前激活的文档。
  2. 在侧边面板中,点击“整图提取”按钮。
  3. 插件立即开始工作:
    • 遍历当前文档的模型空间和所有布局空间。
    • 逐一收集每个 DBText、MText 和 AttributeReference 实体。
    • 对 MText 进行格式码保护处理。
    • 将提取结果组装成翻译会话数据。
  4. 提取完成后,插件会:
    • 显示提取统计信息(提取到的实体总数及分类数量)。
    • 自动打开翻译工作台,将提取结果加载到翻译界面中。

整个过程中,AutoCAD 可能会短暂出现”处理中”的状态(取决于图纸大小),这是正常现象。

4.5.4 方式二:框选提取

当您只需要翻译图纸中的某一个区域时,框选提取是最合适的方式。例如,您只想翻译”设计说明”区域,而不关心图框标题栏和其他标注。

操作步骤

  1. 在侧边面板中,点击“框选提取”按钮。
  2. 插件会将控制权交还给 AutoCAD 的绘图区域,提示您在图纸中进行框选。
  3. 在 AutoCAD 绘图区域中,用鼠标拖拽一个矩形选择框,框住您要提取文字的区域。
  4. 框选完成后(松开鼠标或按回车确认),插件开始工作:
    • 只对框选范围内的文字实体进行提取。
    • 提取逻辑与整图提取完全一致。
  5. 提取完成后,同样会自动打开翻译工作台。

框选提取的注意事项

  • 框选范围遵循 AutoCAD 的默认选择模式(从左到右拖拽为窗口选择——完全包含才选中;从右到左拖拽为交叉选择——部分包含即选中)。具体行为取决于您在 AutoCAD 中的选择设置。
  • 如果框选区域内没有文字实体,提取结果为空,翻译工作台打开后不会有任何待翻译条目。
  • 多次框选:如果需要提取多个不连续的区域,可以分别进行多次框选提取。后续的提取会与之前的提取结果合并(详见 4.8 增量提取)。

4.5.5 “不提取图框文字”选项

在侧边面板的提取选项中,有一个“不提取图框文字”勾选框,这是一个非常实用的过滤功能。

功能说明

  • 图框(Title Block)通常以 BlockReference(块参照)的形式插入到图纸中,其内部的标题栏信息(项目名称、图号、设计人、日期等)以 AttributeReference 的形式存在。
  • 这些图框信息通常是固定的模板文字——同一项目所有图纸的图框文字基本相同,每次提取到翻译工作台都会重复出现,造成冗余。
  • 勾选”不提取图框文字”后,插件在遍历 AttributeReference 时,会判断该属性是否属于图框类型的块参照,如果是则跳过。

使用建议

  • 如果您所在项目有统一的图框标准,且图框文字不需要翻译(或已在模板层面处理),建议勾选此选项。
  • 如果图框中的部分信息(如”项目名称”)确实需要翻译,则不勾选,让它们正常提取到工作台。
  • 如果不确定是否勾选,可以先用默认设置提取一次,在翻译工作台中查看结果,再决定是否需要调整。

4.6 提取进度与状态解读

无论是 Studio 端还是插件端,提取过程中都会呈现一系列状态信息。正确理解这些状态,有助于判断当前进度和排查问题。

4.6.1 Studio 端状态流转

Studio 端的提取状态按以下流程变化:

等待提取 → 准备中 → 提取中 → 完成 / 失败
状态 含义 界面表现
等待提取 文件已添加到任务,但尚未发起提取。 状态列显示”待提取”,操作按钮显示”提取文字”。
准备中 Studio 正在生成提取脚本并启动 Core Console。 进度条出现,步骤文字显示”正在准备提取环境…“。
提取中 Core Console 正在运行,正在加载图纸并提取文字。 进度条动态变化,步骤文字实时更新(如”正在提取文字实体…“),耗时计数器递增。
完成 提取成功,翻译会话文件已生成。 进度条消失,状态变为”已提取”,显示统计信息(实体数量等),操作按钮变为”进入翻译工作台”。
失败 提取过程中出现错误,未能完成。 状态变为”提取失败”,显示错误信息,操作按钮变为”重试”。

4.6.2 插件端状态反馈

插件端的反馈更加即时和简洁:

  • 提取中:AutoCAD 状态栏可能显示”正在处理…“,侧边面板显示进度提示。
  • 提取完成:弹出提示框或在面板中显示统计信息,随后自动跳转翻译工作台。
  • 提取失败:弹出错误对话框,说明失败原因。

4.7 提取完成后的操作

提取完成只是翻译流程的第一步。接下来,您需要进入翻译工作台进行核心的翻译操作。

4.7.1 进入翻译工作台

Studio 端

  1. 在任务详情页面,找到已提取完成的图纸文件。
  2. 点击“进入翻译工作台”按钮(或双击该文件条目)。
  3. Studio 会打开翻译工作台视图,加载该图纸的翻译会话。

插件端

  • 提取完成后翻译工作台会自动打开,无需手动操作。

4.7.2 翻译工作台的基本界面

翻译工作台打开后,您会看到以下内容(不同版本的界面布局可能略有差异,但核心元素一致):

界面区域 说明
原文列表 左侧或上方区域,按图层或类型分组列出所有提取到的文字原文。
译文编辑区 中间区域,为每条原文提供译文输入框。
上下文预览 某些版本可能提供图纸缩略图或文字在图纸中的位置示意。
信息面板 右侧或下方区域,显示当前选中文字的类型、图层、位置等信息。
工具栏 顶部工具栏,提供翻译记忆匹配、术语提示、批量替换、导出导入等功能。

4.7.3 查看提取结果统计

在翻译工作台中,您可以通过以下方式了解提取结果的整体情况:

  • 总数统计:界面标题栏或状态栏通常显示”共 N 条待翻译”。
  • 类型筛选:可以按文字类型(DBText / MText / AttributeReference)筛选,分别查看。
  • 图层筛选:可以按图层筛选,快速定位某个专业或某类标注的文字。
  • 搜索功能:输入关键词,快速找到包含该词的原文。

4.8 增量提取说明

“增量提取”是指对同一张图纸进行多次提取时,系统如何处理新旧数据的行为。

4.8.1 增量提取的机制

当您对一张已经提取过文字的图纸再次执行提取操作时:

  1. 系统识别到该图纸已有绑定的翻译会话(.tw 文件)。
  2. 新提取的文字实体与已有的会话数据进行比较。
  3. 合并规则如下:
情况 行为
新提取到的实体,在已有会话中不存在(通过句柄比对) 新增到会话中,标记为”待翻译”。
已有会话中的实体,在新提取中仍然存在 保留已有数据,包括已翻译的译文。
已有会话中的实体,在新提取中已不存在(图纸中已删除) 标记为失效(而非直接删除),在翻译工作台中显示特殊状态,供人工确认。

4.8.2 增量提取的应用场景

  1. 图纸修改后的补充提取:图纸修改后增加了新的标注或说明文字,再次提取可将新增内容补充进翻译会话,而不影响已翻译完的内容。
  2. 框选多次提取:在插件端,您可以分多次框选不同区域进行提取。每次框选的结果会合并到同一个会话中。
  3. 分批翻译工作流:大型图纸首次可能只提取一部分进行试译,确认翻译风格和质量后,再提取剩余部分。

4.8.3 注意事项

  • 增量提取的前提是图纸文件的身份一致(同一文件路径和同一内部标识符)。如果将图纸另存为新的文件名,系统会将其视为一张新图纸,而不是同一张图纸的增量。
  • 已标记为”失效”的实体并不会自动从会话中删除。如果您确认这些实体确实不再需要翻译,可以在翻译工作台中手动删除。
  • 增量提取不会覆盖已有的翻译结果,所以您可以放心地对同一张图纸多次提取。

4.9 MText 格式保护详解

MText(多行文字)是 AutoCAD 中功能最丰富的文字类型,支持在一段文字内部使用不同的字体、颜色、字高、加粗、倾斜、下划线等格式。这些格式在 DWG 文件内部以特殊的格式码表示。

4.9.1 什么是格式码

格式码是 AutoCAD 内部用于控制 MText 排版的特殊字符串,以反斜杠 \ 开头。常见的格式码包括:

格式码 含义 示例
\fArial|b0|i0|c0|p34; 字体设置(字体名、粗体、斜体、字符集、字间距) \fSimSun|b0|i0|c134|p2;文字
\C1; 颜色设置(颜色索引号) \C1;红色文字
\H0.5x; 字高相对比例因子 \H2x;放大两倍的文字
\L...\l 下划线(\L 开始,\l 结束) \L带下划线的文字\l
\O...\o 上划线 \O带上划线的文字\o
\K...\k 删除线 \K带删除线的文字\k
\P 段落换行 第一行\P第二行
\A1; 对齐方式 \A1;居中对齐
\S...^...; 堆叠文字(分数/公差) \S1/2; 显示为½

一段实际的 MText 内容可能看起来像这样:

\fSimSun|b1|i0|c134|p2;\C4;\H1.5x;重要提示\P\C7;\H1x;以下内容请仔细阅读

这对于翻译人员来说是完全不可读的胡言乱语。

4.9.2 格式保护的工作原理

同文的提取引擎在遇到 MText 时,执行以下处理:

  1. 识别格式码:扫描 MText 的原始内容字符串,识别出所有格式码序列。
  2. 占位符替换:将每个格式码替换为唯一的透明占位符(placeholder),在提取结果中这些占位符对用户不可见。
  3. 生成纯净文本:去除格式码后,得到干净的纯文本内容,呈现在翻译工作台中供翻译人员阅读和翻译。
  4. 保留映射关系:占位符与原始格式码之间的映射关系保存在会话数据中。

4.9.3 用户体验

对于使用翻译工作台的翻译人员来说,MText 格式保护意味着:

  • 看到的是干净的文字:翻译工作台显示的原文是去除格式码后的纯文本,可读性强。例如,上面那段格式乱码在翻译工作台中看到的可能是:

    重要提示
    以下内容请仔细阅读
    
  • 不需要关心格式:翻译人员在输入译文时,不需要考虑任何格式码,只需输入目标语言的纯文本即可。
  • 回写时自动恢复:当译文回写到 DWG 文件时,同文的回写引擎会自动将占位符还原为原始格式码,确保译后文字的字体、颜色、大小、下划线等格式与原文完全一致。

4.9.4 格式保护的注意事项

  • 不要手动修改占位符:在翻译工作台中,您看到的文本是完全干净的。占位符在后台处理,您不需要也不可能手动操作它们。
  • 格式码保护是自动的:无需进行任何设置或勾选,引擎自动处理所有 MText 格式码。
  • 堆叠文字的翻译:对于包含堆叠文字(如分数 ½、公差 +0.01^-0.02)的 MText,堆叠内容也会被正确识别和保护处理。

4.10 提取失败处理

在实际使用中,偶尔会遇到提取失败的情况。以下列出常见原因和对应的处理方法。

4.10.1 Studio 端提取失败

失败原因 症状 处理方法
Core Console 未找到 报错”找不到 accoreconsole.exe”或”Core Console 启动失败”。 检查 AutoCAD 是否正常安装;确认 Core Console 路径是否正确配置在 Studio 中。
插件加载失败 Core Console 启动后立即退出,或报告”插件加载失败”。 确认同文 AutoCAD 插件已正确安装;检查插件是否与 AutoCAD 版本匹配。
图纸文件损坏 Core Console 加载图纸时报错”无法打开文件”或”无效的 DWG 文件”。 尝试在 AutoCAD 图形界面中打开该文件;使用 AutoCAD 的 RECOVER 命令修复图纸。
文件被占用 报错”文件正在被其他程序使用”。 关闭可能正在使用该文件的 AutoCAD 或其他程序后重试。
权限不足 报错”拒绝访问”。 确保 Studio 以管理员权限运行;检查文件所在目录的读写权限。
Named Pipe 通信失败 提取一直停留在”等待数据”状态,最终超时。 检查防火墙或安全软件是否拦截了 Named Pipe 通信;重启 Studio 后重试。
图纸过大 提取时间极长或 Core Console 崩溃。 尝试在 AutoCAD 图形界面中清理图纸(PURGE、AUDIT);如果图纸确实超大,可考虑先拆分图纸。
内存不足 系统提示内存不足或 Core Console 异常退出。 关闭其他占用内存的程序;确认计算机内存满足 AutoCAD 的最低要求。

4.10.2 插件端提取失败

失败原因 症状 处理方法
插件未加载 侧边面板中没有同文的功能按钮,或按钮灰色不可用。 使用 NETLOAD 命令重新加载插件;检查插件是否与当前 AutoCAD 版本匹配。
图纸未保存 提取时报错”图纸未保存”。 先保存当前 DWG 文件(至少保存一次),再进行提取。
文档被锁定 提取时报错”文档被锁定”或”操作无法完成”。 检查是否有其他命令正在执行;按 Esc 取消当前命令后重试。
框选范围无效 框选提取后结果为空或报错。 确认框选范围内确实包含文字实体;必要时使用整图提取作为替代。

4.10.3 一般排障建议

  1. 重启:无论是 Studio 还是 AutoCAD 插件,重启程序是最简单有效的第一步排查手段。
  2. 检查日志:同文通常会在安装目录或用户文档目录生成日志文件,报错信息会记录在日志中,可以据此精确定位问题。
  3. 最小化测试:用一张最简单的图纸(只包含一行 DBText)进行提取测试,以区分是图纸问题还是环境问题。
  4. 更新版本:确保同文 Studio、同文插件和 AutoCAD 都是最新或推荐的版本组合。

4.11 注意事项与最佳实践

4.11.1 图纸准备

  1. 保存并关闭图纸(仅 Studio 端):在 Studio 端提取之前,请确保待提取的 DWG 文件没有被 AutoCAD 图形界面打开并处于编辑状态。虽然 Core Console 会以只读模式加载文件,但为了避免潜在的文件锁定冲突,建议关闭 AutoCAD 中的该文件。
  2. 清理图纸:对于历史较久、反复修改的大型图纸,建议在提取前执行 PURGE(清理未使用的对象)和 AUDIT(审核并修复错误)命令。这可以减少提取过程中遇到意外错误的概率,也能略微加快提取速度。
  3. 检查文字显示:在 AutoCAD 中打开图纸,使用 QTEXT 命令检查是否有文字被设置为”快速文字”模式(显示为方框)。快速文字模式不影响提取结果,但如果文字使用了特殊的 SHX 字体,在翻译工作台的预览中可能显示为乱码——这是字体渲染的问题,不影响提取和回写。
  4. 统一文件版本:确保 DWG 文件的保存格式与 AutoCAD 版本一致。虽然同文支持多版本的 DWG/DXF,但旧版本格式(如 AutoCAD 2000 之前的格式)可能存在兼容性问题。

4.11.2 提取策略

  1. 优先使用整图提取:对于没有特殊要求的场景,整图提取是最全面、最不会遗漏的方式。框选提取虽然方便,但容易因为漏选而导致译文不完整。
  2. 善用”不提取图框文字”:如果项目图框是标准化的且不需要翻译,勾选该选项可以大幅减少翻译工作台中的条目数,让翻译人员专注于图纸正文。
  3. 小批量处理:如果需要翻译多张图纸,建议先提取 1~2 张进行试译,确认翻译工作台的使用方式、术语风格和译文质量后,再批量处理剩余图纸。
  4. 及时保存会话(插件端):如果您在 AutoCAD 插件端进行提取,翻译工作台的修改会实时保存到会话文件中。但如果您在翻译过程中关闭了 AutoCAD,请确认翻译进度已保存。
  5. 增量提取前确认范围:如果您因为图纸修改而再次提取,请在提取完成后进入翻译工作台,快速浏览一遍,确认新增的条目是否符合预期。

4.11.3 格式相关

  1. MText 格式保护是透明的:提取和回写过程中格式码的保护和还原是完全自动的,您不需要做任何额外操作。唯一需要注意的是,如果您在翻译工作台中手动对译文进行了特殊排版(如添加自己的换行),回写后可能会与原始格式产生冲突。
  2. 特殊字符处理:工程图纸中常见的特殊字符(如直径符号 φ、角度符号 °、正负号 ±)在提取过程中会被保留。如果在翻译工作台中看到这些符号显示异常,通常是字体问题,不影响回写。
  3. 多层嵌套的 MText:某些图纸的 MText 可能包含复杂的多层嵌套格式码(例如一段多行文字中,某几个字使用了特殊字体,某几个字又有下划线)。同文的格式保护引擎对此完全支持,翻译工作台始终显示纯净文本。

4.11.4 工作流程

  1. 建立标准流程:对于团队协作的翻译项目,建议制定标准的操作流程文档,明确由谁负责提取、谁负责翻译、谁负责校对、谁负责回写,避免操作混乱。
  2. 文件命名规范:为翻译任务和会话文件建立统一的命名规则,例如”项目编号-图纸编号-语言对-版本号”,便于后续查找和管理。
  3. 定期备份.tw 会话文件包含了所有提取数据和翻译进度,建议定期备份到安全位置。
  4. 提取后先浏览:在开始翻译之前,先花几分钟浏览提取结果。检查是否有明显的遗漏(如某个图层的文字未提取)、是否有不需要翻译的内容(如图号中的数字)、是否有重复条目。这些前期检查可以为后续翻译工作扫清障碍。

4.11.5 常见问题速查

问题 解答
提取耗时很长 检查图纸大小和复杂度;在 AutoCAD 中执行 PURGE 和 AUDIT 后重新提取。
提取结果中文字乱码 通常是 AutoCAD 缺少对应 SHX 字体文件,不影响翻译和回写,回写后文字恢复原样。
提取后翻译工作台空白 确认图纸中确实包含文字实体(而非标注尺寸文字——标注文字属于 Dimension 对象,不在本章讨论范围);检查是否有”不提取图框文字”导致内容被过滤。
框选提取的结果包含不需要的文字 在 AutoCAD 中重新框选更精确的范围后再次提取。
多次提取后出现重复条目 系统会通过句柄去重,不应出现重复。如果出现,可能是图纸文件被另存为不同的文件。
翻译工作台中看不到译文预览的图纸背景 某些版本可能不带图纸预览功能,这不影响翻译工作。

4.12 本章小结

本章详细介绍了同文”图纸文字提取”功能的全部内容:

  1. 提取对象:DBText(单行文字)、MText(多行文字)、AttributeReference(块属性文字)三大类型。
  2. 两种提取方式:Studio 桌面端提取(适合批量任务管理)和 AutoCAD 插件端提取(适合即时交互操作)。
  3. 提取流程:从新建任务、添加图纸、发起提取到 Core Console 后台执行的完整过程。
  4. 增量和格式保护:多次提取的智能合并机制,以及 MText 格式码的自动保护与还原。
  5. 排障与最佳实践:常见失败原因及处理方法,以及提升效率的操作建议。

文字提取是同文翻译工作流的起点。掌握本章内容后,您就可以高效、准确地将图纸中的文字提取到翻译工作台,进入下一阶段——文字翻译(详见后续章节)。


下一篇:[第05章:翻译工作台操作指南](待更新) 上一篇:[第03章:项目与任务管理](待更新) 返回同文教程目录