首页 专利交易 科技果 科技人才 科技服务 国际服务 商标交易 会员权益 IP管家助手 需求市场 关于龙图腾
 /  免费注册
到顶部 到底部
清空 搜索

基于大语言模型的工业视觉多下游任务处理方法 

买专利卖专利找龙图腾,真高效! 查专利查商标用IPTOP,全免费!专利年费监控用IP管家,真方便!

申请/专利权人:杭州汇萃智能科技有限公司

摘要:本发明公开了基于大语言模型的工业视觉多下游任务处理方法,包括以下步骤:获取工业查询图像和提问文本,将所述工业查询图像分割为多个图像块,将图像块送入图像特征编码器提取图像特征,并将图像特征转换为查询图像令牌;识别所述提问文本得到视觉任务类型,根据系统设定、所述提问文本、所述视觉任务类型和所述查询图像令牌,生成大语言模型的输入文本;将所述输入文本所述大语言模型,所述大语言模型根据指定的任务类型、输入的系统设定和任务需求,处理不同的视觉任务。本发明能够高效且准确地处理工业视觉场景中的多种下游任务,并在工业视觉多下游任务上提高大模型的适应性和性能。

主权项:1.一种基于大语言模型的工业视觉多下游任务处理方法,其特征在于,包括以下步骤:获取工业查询图像和提问文本,将所述工业查询图像分割为多个图像块,将图像块送入图像特征编码器提取图像特征,并将图像特征转换为查询图像令牌;识别所述提问文本得到视觉任务类型,根据系统设定、所述提问文本、所述视觉任务类型和所述查询图像令牌,生成大语言模型的输入文本;将所述输入文本所述大语言模型,所述大语言模型根据指定的任务类型、输入的系统设定和任务需求,处理不同的视觉任务;所述视觉任务类型包括:图像描述任务、目标检测任务、异常检测任务、分割任务、分类任务和计数任务;目标检测任务的数据处理包括步骤:将所述工业查询图像坐标值归一化到0-99的范围内,其中0代表图像的最左边x或最上边y,99代表图像的最右边x或最下边y;标注每个目标物体的位置和形状信息,每个目标物体的标注信息包括中心点坐标x,y、宽度w、高度h以及旋转角度θ;中心点坐标x,y:表示目标物体中心点在图像中的位置;宽度w和高度h:分别表示目标物体的宽度和高度,尺寸归一化到0-99的范围内,表示目标相对于整个图像尺寸的比例;旋转角度θ:表示目标物体相对于图像水平线的旋转角度,范围从-180度到180度,旋转角度0表示未旋转,正值表示顺时针旋转,负值表示逆时针旋转;异常检测任务的数据处理包括步骤:将所述工业查询图像分成24x24个网格得到574个图像块,每个图像块代表图像的一小部分,状态表示为0或1,其中0表示该图像块不包含目标物体或异常区域,1表示包含目标物体或异常区域;对于每行中连续的三个图像块,将基于三个图像块的所有可能状态组合编码为一个0到7的数字,每一行分成了8组连续的三个图像块,因此每行可以用8个0到7之间的序列号来表示;序列号输出:所述工业查询图像的异常检测结果将输出为24个序列号,每个序列号对应图像中的一行,表示所述工业查询图像的异常检测状态。

全文数据:

权利要求:

百度查询: 杭州汇萃智能科技有限公司 基于大语言模型的工业视觉多下游任务处理方法

免责声明
1、本报告根据公开、合法渠道获得相关数据和信息,力求客观、公正,但并不保证数据的最终完整性和准确性。
2、报告中的分析和结论仅反映本公司于发布本报告当日的职业理解,仅供参考使用,不能作为本公司承担任何法律责任的依据或者凭证。