ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Botty的OCR魔法:Tesseract如何识别地面物品?词表、正则与纠错机制揭秘

Botty的OCR魔法:Tesseract如何识别地面物品?词表、正则与纠错机制揭秘 Botty的OCR魔法Tesseract如何识别地面物品词表、正则与纠错机制揭秘【免费下载链接】bottyD2R Pixel Bot项目地址: https://gitcode.com/gh_mirrors/bo/bottyBotty 是一款开源的D2R暗黑破坏神2重制版像素机器人它能自动跑图、捡物、换装。但一个看图说话的程序如何分辨地上的文字是 FLAWLESS RUBY无瑕红宝石还是垃圾本文带你揭秘 Botty 基于Tesseract OCR的文字识别体系预训练词表、正则纠错和模糊匹配三层机制如何让一个开源 OCR 引擎稳定读懂暗黑风格像素字体。为什么 OCR 是像素机器人的核心能力D2R 没有对外接口机器人看得见的只有屏幕截图。物品信息名字、等级、词缀全部以像素文字形式存在因此必须借助 OCR光学字符识别把图像转成文本再交给 BNIP 词缀解析引擎判断物品价值。整个图像识别管线位于 src/d2r_image/ 目录核心入口函数是 image_to_text()它完成了图像 → 文本的全过程。第一步两套专门训练的 Tesseract 模型Tesseract 默认不擅长暗黑这种细像素字体。Botty 的解法是自训练模型用真实游戏截图 人工标注的文本样本标注工具见 gen_ocr_samples.py训练出两套 LSTM 模型存放在 assets/tessdata/ground-eng_inconsolata_inv_th_fast识别地面物品名称单行文字hover-eng_inconsolata_inv_th_fast识别悬停提示框多行属性文字模型加载时还会读取 ocr_config.txt对非词表词施加语言模型惩罚——让模型更信任词表里的词这是后面纠错机制的第一道伏笔。第二步图像预处理让像素字变得可读原始截图中物品文字是彩色的、边缘还带着背景噪点。image_to_text() 在送入 Tesseract 前做了一连串处理缩放scale小字体放大后更易识别腐蚀去边erode地面物品专用erode_to_black() 用形态学重建抹掉文字周围的彩色噪点只留下文字裁剪补白crop_pad去掉图块边缘干扰灰度 二值化阈值把图像变成纯黑白反色invert暗黑是白字黑底Tesseract 偏好黑字白底识别地面物品时的实际调用在 processing_helpers.py先按文字颜色聚类定位物品区域再批量送入ground模型psm7表示单行文字模式。第三步三层纠错机制Tesseract 输出只是起点Tesseract 再准也会犯错——I和1、O和0、S和5在像素字体里几乎无法区分。Botty 在 ocr.py 里设计了三层递进的纠错流水线1️⃣ 正则规则修正_fix_regexps针对字母数字混淆写了一组带上下文的正则定义在 ocr_data.py场景示例规则词中的1其实是IW1RTS LEG两侧是大写字母 → 替换为I数字旁的I其实是132I to mana两侧是数字/符号 → 替换为1孤立的I/S/OI TO 5 DEFENSE单独成词 → 替换为1/5/0完整的上下文判断逻辑见 _fix_regexps()。2️⃣ 已知错误映射表_check_known_errors有些词 Tesseract 的错法非常固定直接查表替换。ERROR_RESOLUTION_MAP 里收录了几十个固定错误例如SHIFLD→SHIELDSPFAR→SPEARCLAVMORE→CLAYMOREIOX%→10%3️⃣ 词表模糊匹配_ocr_result_dictionary_check最后一层最聪明把每个词拿去和完整词表做模糊匹配find_best_match() 使用 rapidfuzz 的 Levenshtein 编辑距离归一化相似度 ≥ 0.6 才替换避免错改。它还有一个亮点——前瞻合并如果 OCR 把单词中间的空格读丢了或把两个词读碎S11PER这种算法会尝试当前词 下一个词合并后再匹配词表取更优解详见 _ocr_result_dictionary_check()。词表OCR 的知识库模糊匹配的效果取决于词表质量。Botty 在 assets/word_lists/ 维护了 5500 条词条all_words.txt约 3850 词全部合法词含基础物品、符文、技能与词缀base_items.txt基础装备/武器名称magic_prefixes.txt 与 magic_suffixes.txt魔法前后缀加载逻辑在 strings_store.py带缓存词表同时被注入给 Tesseractuser_words_file和纠错层一份数据两处受益。总结一张图像到物品的完整链路把整条链路串起来Botty 识别一件地面物品的流程是截图 → 颜色聚类定位文字 → 腐蚀/二值化预处理 → Tesseract 自训练模型识别 → 正则修正 → 已知错误查表 → 词表模糊匹配 → BNIP 解析物品价值 → 自动拾取这套模型特化 预处理 三层纠错的组合拳展示了在受限像素字体场景下用好开源 OCR 的完整思路——对任何想给复古像素游戏做图像识别的项目都有很强的参考价值。关键文件速查OCR 核心src/d2r_image/ocr.py正则与错误表src/d2r_image/ocr_data.py地面物品定位管线src/d2r_image/processing_helpers.pyOCR 模型与配置assets/tessdata/词表数据assets/word_lists/开发文档development.md【免费下载链接】bottyD2R Pixel Bot项目地址: https://gitcode.com/gh_mirrors/bo/botty创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表