直招.cv

← 返回职位列表

阶跃星辰 校园招聘

多模态大模型算法实习生-OCR方向

地点未注明 ·经验不限·学历不限

职位描述

岗位职责 OCR领域多模态大模型学术进展跟进: 跟踪学术界与工业界最新发布的OCR、文档理解、图表解析等相关领域工作,定期进行总结分享 深入理解目前广泛使用的OCR评估体系(包括但不限于NED、CDM、TEDS等指标),参与评测基准的构建与维护,并设计更贴近用户体感的OCR评测方案 OCR数据建设 调研并分析经典文档图像合成方法(如SynthDoG)及其他OCR训练数据合成最佳实践,据此参与设计与开发高效的数据合成pipeline,覆盖各OCR子任务 调研基于LaTeX/HTML/Markdown的文档页渲染方法,参与搭建并优化相关pipeline与工程实现 探索适合OCR任务的数据增强技术,包括几何变换、噪声注入等,并在实际数据上应用 OCR专家模型训练 探索并设计适合OCR任务的VLM训练算法/模型结构 探索并搭建OCR领域的数据飞轮,寻求数据-模型协同进化的训练策略 职位要求 教育背景 研究生在读,计算机/人工智能/模式识别相关专业优先 技术能力 熟练掌握Python编程,熟悉OpenCV、PIL等图像处理库 熟练掌握Pytorch等深度学习训练框架,同时熟练掌握Transformer/Megatron等大模型训练框架 深入理解多模态大模型(VLM)基础原理,对OCR相关任务有一定基础认知 经验要求 (优先)具备文档图像处理经验,了解传统文本检测(DB、EAST等)、传统文本识别(CTC等)、表格识别等经典OCR方法的同学优先 (优先)熟悉最新OCR相关工作(例如DeepSeekOCR2,MinerU2.5,PaddleOCR-VL等)的同学优先 (优先)有OCR数据合成,LaTeX/HTML/Markdown渲染工程经验的同学优先 工程与学习能力 具备利用大模型工具快速学习新技术的能力,能独立阅读前沿论文并获取关键insight 有大规模数据处理、分布式训练经验者优先 团队协作 良好的沟通能力和团队合作精神,能够与算法、工程团队密切协作 实习信息 实习时间:实习6个月或以上 工作地点:北京市海淀区苏州街大恒科技大厦 线下办公

官网发布:2026-03-02 · 最后确认在招:2026-09-03 20:15:56 · 来源平台:moka