7月17日,当中国工程院院士、之江实验室主任王坚在waic2026主论坛上提出“让科学数据成为基础模型的原住民(first-class citizen)”这一前瞻性主张时,会场另一侧,一家来自北京的科技企业正以专利数据为切口,交出一份扎实的实践答卷。
在2026世界人工智能大会静安人工智能应用创新示范区内,北京八月瓜科技有限公司展出的擎策全球科技情报检索分析平台吸引众多目光——它将覆盖全球的专利文献、学术论文与产业动态,系统性转化为支撑科研突破的“科学数据燃料”,助力科研工作者“看得清方向、走得稳路径”。
为创新配备“智能导航图”
“科研主体最常面临的两大隐忧:一是陷入低效重复研发,二是无意中踏入他人专利布局的‘禁区’。”八月瓜科技董事长李长青指出,该平台整合了来自全球178个国家和地区的专利数据库、科技文献资源及产业链信息,并依托AI技术与自研大模型完成数据清洗、语义标引、跨源关联与深度分析,“核心目标,就是帮创新者‘少绕路’、‘不踩坑’。”
据悉,平台采用五级递进式技术架构,从底层的科创全息数据池,逐层向上延伸至用户交互应用层,贯穿研发前期的情报研判、研发中期的专利导航、研发后期的成果评估与转化支持全流程。目前,平台已建成超2亿条专利记录、总计达26亿条的多源异构科技数据资源池,服务对象涵盖逾万家高新技术企业、高校及科研院所等重点创新单位。
“妙算”大模型攻坚专利解析“深水区”
谈及技术攻坚难点,李长青坦言,最大挑战在于将高度专业化、结构复杂的专利文本,转化为机器可理解、可计算、可推理的高质量结构化知识。“专利本质是法律文书,术语密集、权利要求嵌套严密,还包含大量化学结构式、电路图、流程附图等非文本要素。”
为此,团队自主研发了面向知识产权领域的垂直大模型——“妙算大模型”,并配套推出“擎策”智能分析平台,采用“AI初筛+专家精标”的双轨机制:机器端承担海量数据的标准化清洗、去重与多维标引;人工端则聚焦高价值专利,进行细粒度解构——精准识别技术问题、核心技术方案、差异化创新点等关键要素。“妙算大模型”已获科技部“新一代人工智能国家科技重大专项”立项支持,有效破解通用大模型在专利场景中“外行看热闹、内行难信任”的现实困境。
“正是这种长期高强度投入,构筑起八月瓜在专业科技数据服务领域的独特护城河。”李长青表示。
专利数据:AI for Science 的“高能燃料”
当前,高质量科学数据集建设已成为全球AI发展的战略焦点。王坚院士在同日主论坛强调:“未来竞争的关键,不在于堆叠更大参数的语言模型,而在于让科学数据真正成为基础模型的‘原生居民’。”在八月瓜看来,以专利为核心的科技数据,正是驱动AI for Science落地的关键“高能燃料”。李长青将其形象比喻为科技创新的“浓缩铀”:“全球90%以上的前沿技术信息,首次公开即通过专利渠道发布;专利数据兼具技术深度与法律效力,在数据来源可信、内容质量可信、应用场景可信三大维度上具备天然优势。”
对于为何选择静安作为本次WAIC展示落地点,李长青解释称,静安区汇聚了大量数据智能头部企业与丰富多元的应用场景,“作为一家扎根北京的企业,我们非常荣幸能将‘AI+知识产权数据’的全栈能力引入静安、辐射上海,携手本地创新生态,共同推动专利这一‘战略性数据资产’向科研实绩与产业动能高效转化。”
李长青进一步透露,八月瓜正加速推进“专利数据+期刊论文数据”融合知识图谱构建,并将持续深化与静安区、上海市的战略协同。公司近期已完成超4亿元新一轮融资,由北京市人工智能产业基金等国有资本联合领投,资金将重点投向全球科技数据资源整合升级及“妙算大模型”的持续训练与能力迭代。
据平台实测数据显示,该系统可助力创新主体平均降低约40%的研发投入成本、缩短约60%的研发周期,关键环节研发效率最高提升超3倍。
从主论坛上掷地有声的“科学数据原住民”理念,到展台前高效运转的专利智能引擎,八月瓜的探索,正是这一前沿范式在知识产权领域的生动落地——当科学数据真正融入模型血脉、驶入产业轨道,每一次技术创新,都将拥有更坚实、更精准、更可信赖的数据基座。



















