DeepSeek开源3B OCR模型:长文本识别达97%精度

DeepSeek近日在GitHub平台开源其最新成果——DeepSeek-OCR模型,该模型通过创新的光学二维映射压缩技术,在长文本识别场景中实现97%的识别精度,模型采用双模块架构设计,由DeepEncoder视觉编码器与DeepSeek3B-MoE-A570M混合专家解码器构成。其中,DeepEncoder可在处理高分辨率图像时自动维持低激活状态,通过动态压缩生成最优数量的视觉特征令牌(visual tokens),较传统方法减少60%的计算冗余。

上一篇:

下一篇:

发表回复

登录后才能评论
分享本页
返回顶部
🍁
🔈Hi,朋友。欢迎来到 木木的博客小站