车牌识别从模型到落地:三级识别流水线的工程实践
车牌识别是计算机视觉落地的经典场景,但"模型能识别"和"系统能落地"之间隔着工程化的鸿沟。本文以我们智能停车场项目的实践为例,讲清三级识别流水线的设计取舍与实测数据。
为什么不能直接用多模态大模型
多模态大模型(如 Qwen-VL 系列)确实"看得懂"车牌:把一张含车牌的照片发给它,它能读出号码甚至描述车型颜色。我们实测单次识别耗时 2~6 秒——对管理后台的补录场景可以接受,但对道闸秒开的实时场景完全不可用。
更本质的问题是大模型推理的固定开销:无论图片大小,一次生成式推理都在秒级。而车牌识别需要的是毫秒级的专用模型,不是通用智能。
三级识别流水线设计
我们的生产架构按"先快后准"分层:
- 第一级 整图字符识别:PaddleOCR-VL 直接识别整图,毫秒级,覆盖近距离清晰车牌——实测 194~914ms
- 第二级 检测裁剪精识别:整图读不出时(远摄小车牌、复杂背景),YOLO 车牌检测框出车牌区域,裁剪放大后再送 PaddleOCR 按车牌精识别
- 第三级 多模态大模型兜底:前两级都失败时(极端场景),大模型"看图"补判,慢但聪明
实测数据
近距双牌场景图:整图 OCR 822ms,两牌全中。单牌特写:194ms。远摄模拟(缩图至 10%,车牌字符仅数像素):整图 OCR 789ms 仍读出(1 字符误读)。
YOLOv8 车牌检测(ONNX,CPU 推理)单帧约 50ms,检出后裁剪 OCR 路径合计约 800ms——在第二级场景中,比直接上大模型兜底(2~6 秒)快 3 倍以上。
生产部署形态
智能停车场场景的完整部署:YOLOv8 检测 + PaddleOCR 字符识别部署在现场边缘网关,摄像头 / RTSP 实时流接入,识别结果写入进出通行记录(时间窗去重防重复识别),对接黑白名单告警与道闸 / 计费系统。全部组件支持内网私有化部署。
有类似需求?
📞 18105711537
联系御码,获取与贵司业务匹配的技术方案与报价。
