处理前保留一份参考
保存未经修改的副本,或保持源文件打开。工具可以一致地执行清理规则,但无法判断某个换行是在分隔两个地址,还是仅仅到了 PDF 栏目的边缘。
先选一小段有代表性的内容尝试。如果整篇包含标题、正文和列表,样本也应尽量涵盖这几种结构。
先处理两端空格
普通段落前后的空格往往是复制时产生的,可以先清理这些空格,再考虑改变行结构。
正文内部连续空格也常常多余,但纯文本表格可能恰好用这些空格对齐。类似表格的内容应单独检查,避免对整篇应用过强的清理规则。
区分自动折行与真正分段
PDF 可能在每个视觉行末插入换行。合并这些换行可以恢复段落,但一次删除全部换行也可能把标题、列表项和不同说话人的内容合到一起。
更稳妥的顺序是先识别真正的段落边界,再合并不需要的折行,最后减少过多空行。合并后检查连接处是否仍有必要的空格。ToolRook 可以删除空行,但不会合并自动折行,必要时请在文本编辑器中完成这一步。
检查行末附近的单词
印刷页面中跨行的英文单词,复制后可能变成带连字符的两部分。连字符可能只是排版标记,也可能属于真实的复合词。
不要自动删除所有连字符。遇到无法确定的词,请对照源文档。还应留意字母 O 与数字 0 等 OCR 混淆,清理空格无法确定原本应该是哪一个字符。
结构化文本需要单独处理
代码、诗歌、邮寄地址和表格数据会用空白表达结构。如果不明确其用途,应保留原始缩进与换行。
清理普通正文后,读一遍各段首尾,核对列表项;如果要填入有长度限制的表单,再检查字符数。文本变短只有在仍保留原意时才有价值。
- 检查标题与编号列表是否意外合并。
- 检查原换行位置的标点与间距。
- 严格投稿限制以目标平台自己的计数为准。
- 在最终使用位置检查完成前,保留原始文本。
现在就用工具试一试。
查看全部工具