图像CV和OCR算法工程师
我们依托创新领域海量数据,打造面向研发和IP人的智能平台,正亟需精通计算机视觉与OCR技术的工程师,通过多模态建模与图像理解技术,解锁图文数据的深层价值。加入我们,你将有机会将前沿算法落地于真实业务场景,推动智能文档处理与图像分析领域的技术突破!简历请投:
## 职位描述
多模态模型(VLM)应用与落地
文字/图像OCR与计算机视觉算法研发
文档图像内容理解系统构建
算法优化与前沿技术工程化
## 岗位职责:
1. 负责多模态模型(如Qwen、LLaVA等VLM模型)的研究与应用,将预训练模型与文档问答、表格抽取、图像检索等实际业务场景深度结合,解决图文交互中的核心问题。
2. 从事文字OCR、图像识别、计算机视觉、机器学习与模式识别等人工智能算法的设计与研发,提升图文内容提取的准确性与效率。
3. 参与文档图像内容理解相关业务系统的设计、开发与集成,支撑复杂版式文档的智能解析与结构化处理。
4. 针对实际业务痛点优化已有算法和系统,提升模型效果与运行性能,解决大规模数据场景下的工程化难题。
5. 跟踪计算机视觉、OCR、多模态大模型等领域的前沿进展,将创新技术工程化应用到公司产品中,实现效果、性能与用户体验的全面优化。
## 任职资格:
1. 计算机、数学、自动化等相关理工科专业,本科及以上学历。
2. 3年以上计算机视觉、图像处理、OCR相关工作经验,具备实际项目落地经验。
3. 具备扎实的编程能力,熟练掌握Python,熟悉深度学习模型的工程化实现。
4. 掌握深度学习框架(TensorFlow和/或PyTorch),了解Diffusion系列模型、大模型等前沿算法者优先。
5. 有VLM(视觉语言模型)相关经验,或在文档理解、表格识别、图像检索等场景有实战经验者优先。
6. 具备良好的问题分析与解决能力,较强的创新意识与团队协作精神,能快速跟进技术趋势并应用于实际工作。