阶跃星辰 校园招聘
多模态大模型算法实习生-OCR方向
地点未注明 ·经验不限·学历不限
薪资面议
前往 阶跃星辰 官网投递
职位描述
岗位职责
OCR领域多模态大模型学术进展跟进:
跟踪学术界与工业界最新发布的OCR、文档理解、图表解析等相关领域工作,定期进行总结分享
深入理解目前广泛使用的OCR评估体系(包括但不限于NED、CDM、TEDS等指标),参与评测基准的构建与维护,并设计更贴近用户体感的OCR评测方案
OCR数据建设
调研并分析经典文档图像合成方法(如SynthDoG)及其他OCR训练数据合成最佳实践,据此参与设计与开发高效的数据合成pipeline,覆盖各OCR子任务
调研基于LaTeX/HTML/Markdown的文档页渲染方法,参与搭建并优化相关pipeline与工程实现
探索适合OCR任务的数据增强技术,包括几何变换、噪声注入等,并在实际数据上应用
OCR专家模型训练
探索并设计适合OCR任务的VLM训练算法/模型结构
探索并搭建OCR领域的数据飞轮,寻求数据-模型协同进化的训练策略
职位要求
教育背景
研究生在读,计算机/人工智能/模式识别相关专业优先
技术能力
熟练掌握Python编程,熟悉OpenCV、PIL等图像处理库
熟练掌握Pytorch等深度学习训练框架,同时熟练掌握Transformer/Megatron等大模型训练框架
深入理解多模态大模型(VLM)基础原理,对OCR相关任务有一定基础认知
经验要求
(优先)具备文档图像处理经验,了解传统文本检测(DB、EAST等)、传统文本识别(CTC等)、表格识别等经典OCR方法的同学优先
(优先)熟悉最新OCR相关工作(例如DeepSeekOCR2,MinerU2.5,PaddleOCR-VL等)的同学优先
(优先)有OCR数据合成,LaTeX/HTML/Markdown渲染工程经验的同学优先
工程与学习能力
具备利用大模型工具快速学习新技术的能力,能独立阅读前沿论文并获取关键insight
有大规模数据处理、分布式训练经验者优先
团队协作
良好的沟通能力和团队合作精神,能够与算法、工程团队密切协作
实习信息
实习时间:实习6个月或以上
工作地点:北京市海淀区苏州街大恒科技大厦 线下办公
官网发布:2026-03-02 · 最后确认在招:2026-09-03 20:15:56 · 来源平台:moka