超越众多开源模型 诺谛智能拿下C-MTEB榜单第一

近日,诺谛智能“支点”向量模型凭借多样化困难样本采样策略以及基于“支点”大模型的数据合成,超越众多开源模型,拿下主流权威评测C-MTEB榜单排名第一。

  

       

MTEB(Massive Text Embedding Benchmark)是用于评估文本嵌入模型的一系列评估指标的集合,对应的C-MTEB则被公认为是目前业界最全面、最权威的中文语义向量评测基准之一,涵盖了分类、聚类、检索、排序、文本相似度、STS等6个经典任务,共计35个数据集,为深度测试中文语义向量的全面性和可靠性提供了可靠的实验平台,众多行业领先的开源模型都会参与评测,榜单竞争激烈。

  

此次获得C-MTEB榜单排名第一的诺谛“支点”向量模型,采用了多样化困难样本采样策略,其针对分类和聚类、检索、排序以及句对匹配任务设计了不同的困难样本选择策略。同时该模型还采用了基于诺谛“支点”行业大模型的数据合成,抖客网,通过多样化的数据合成策略对分类、聚类、句对匹配样本进行重写,为每个样本构造出多个合成样本,并针对检索和排序任务对问题和文章同时进行增强,可生成多个检索问题。此外,对于不同场景的检索任务,“支点”向量模型还设计了多样化损失函数,结合梯度累积策略以及数据调度策略,最终使诺谛“支点”向量模型在分类、聚类、句对匹配、检索、排序任务上的性能大幅提升。

  

在实际应用中,“支点”向量模型为了满足不同业务实际场景对向量的差异化需求,在训练过程中引入了MRL技术,可根据指定维度的向量计算多个附加损失,使其可以输出不同维度的向量用于下游任务,进一步提升实际业务场景下分类、聚类、检索、排序、文本相似度等任务的AI能力。

  

而作为大模型的最主要应用场景之一,RAG技术需要配合大模型和向量模型来落地,而诺谛开源了行业顶尖中文RAG场景向量模型,在为AI领域的持续创新提供助力的同时,也可以赋能更多制造企业实现智能化升级。

原标题:【超越众多开源模型 诺谛智能拿下C-MTEB榜单第一
内容摘要:近日,诺谛智能“支点”向量模型凭借多样化困难样本采样策略以及基于“支点”大模型的数据合成,超越众多开源模型,拿下主流权威评测C-MTEB榜单排名第一。 MTEB(Massive Text Embedding Benchm ...
文章网址:https://www.doukela.com/jc/278068.html;
免责声明:抖客网转载此文目的在于传递更多信息,不代表本网的观点和立场。文章内容仅供参考,不构成投资建议。如果您发现网站上有侵犯您的知识产权的作品,请与我们取得联系,我们会及时修改或删除。
上一篇:恩克巴雅尔(和平)
下一篇:少儿如意两全保险:一份保险,双重保障,孩子未来更安心