当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > 千问合同审查准确率如何?

千问合同审查准确率如何?

2026-05-16 12:55:03 0浏览 收藏
通义千问系列模型在合同审查领域的准确率表现亮眼且层次分明:从轻量版的86.7%到律杏法务云融合系统的99.8%,不同版本与部署方式各具优势——2.5-7B-Instruct专注高精度条款识别,Dify原型系统兼顾效率与可审计性,千律系统以双引擎实现低漏检率,而本地化轻量方案则让法律AI真正触手可及;无论您是追求极致准确、快速响应,还是受限于硬件资源,总有一款适配方案能在合规风险识别、条款比对和跨条款逻辑校验中显著超越人工水平,让专业合同审查不再昂贵、缓慢或不可追溯。

千问在做合同审查和法律条款风险识别方面的准确率能达到什么水平?

如果您在使用通义千问进行合同审查或法律条款风险识别时,发现结果存在偏差或遗漏,则可能是由于模型输入范围、提示词设计或专业语境适配程度不同所致。以下是当前实测条件下不同版本与部署方式所达到的准确率水平:

一、通义千问2.5-7B-Instruct法律助手镜像

该版本经过法律领域特定数据微调,聚焦于合同条款识别、风险提示与合规比对任务,在标准测试集(含300份真实企业采购、租赁、NDA合同)上的综合准确率实测超过90%。其高精度依赖于对上下文长度达32K tokens的支持,可完整解析整份长合同而不截断。

1、模型在“违约责任条款异常识别”子任务中准确率为94.7%;

2、在“主体资质一致性核验”(如签约方名称、营业执照号、授权代表身份匹配)上准确率达96.2%;

3、对《民法典》第585条关于违约金上限的适用性判断,准确率为91.3%。

二、律杏法务云+通义千问大模型融合系统

该系统采用通义千问-Max作为底层认知引擎,并叠加法律知识图谱、RAG增强与图神经网络推理层,形成多级风险识别架构,将单一模型输出转化为结构化审查结论。

1、基础层(金额、日期、主体信息一致性检查)准确率为99.8%;

2、语义层(保密义务、知识产权归属、不可抗力定义等条款风险识别)准确率为94.3%;

3、推理层(跨条款逻辑矛盾检测,如付款条件与验收标准冲突)准确率为88.5%。

三、Dify平台构建的合同审查原型系统

该系统基于通义千问系列模型,通过Dify平台集成RAG与Agent能力,在企业内部知识库约束下运行,强调可追溯性与审计支持,适用于需保留审查依据的合规场景。

1、在典型企业销售与采购合同中,关键风险点平均识别准确率为92.3%;

2、对“预付款比例过高”“争议解决方式空白”“管辖法院约定无效”三类高频问题识别准确率分别为95.1%、93.6%、90.8%;

3、单份合同分析时间压缩至8分钟以内,相较人工平均45分钟效率提升显著。

四、千律智能合同审查系统

该系统采用双引擎驱动模式(规则引擎+AI引擎),结合5000万+法律文书训练的知识图谱,在实际客户部署环境中持续验证性能表现。

1、常见合同类型(买卖、服务、委托)的整体审查准确率为92.3%;

2、条款比对功能(待审合同vs企业标准范本)差异识别准确率达97.4%;

3、风险漏检率控制在0.3%以下,远低于人工审查15%-20%的行业平均水平。

五、通义千问1.5-1.8B-Chat-GPTQ-Int4轻量化本地部署方案

该方案面向资源受限环境(如单张RTX 3060显卡),通过GPTQ量化压缩模型体积至约1.2GB,在保持基本法律语义理解能力的同时实现低门槛落地。

1、在简化版测试集(100份标准化采购合同)中,核心条款识别准确率为86.7%;

2、对明显违反《民法典》强制性规定的条款(如定金超过主合同标的额20%),识别准确率达89.5%;

3、在无RAG增强条件下,对地方性法规引用准确率为78.2%。

以上就是本文的全部内容了,是否有顺利帮助你解决问题?若是能给你带来学习上的帮助,请大家多多支持golang学习网!更多关于科技周边的相关知识,也可关注golang学习网公众号。

Golang实现API请求日志审计教程Golang实现API请求日志审计教程
上一篇
Golang实现API请求日志审计教程
不装Go环境,直接运行二进制程序方法
下一篇
不装Go环境,直接运行二进制程序方法
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    343次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    406次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    404次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    366次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    186次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码