高质量的代码训练数据稀缺、分散在私有仓库里、还常常权属不清。codecorpus 正在搭一个有授权的市场:整合、授权、供应的三方入口。
公开代码在被大量消耗。模型越来越需要真实、有深度、带稀有语言、且能拿出授权依据的企业级代码。
多年生产经验停在离职团队和前公司的私仓里。没人建过一条合规、可规模化的渠道把它们带到市场。
轻量自测脚本(git 历史、作者、跨度、重复率、自研占比)+ 正式授权框架。两端都有护城河。
只收有权处置的代码,签书面协议,每个数据集都可溯源。我们开创的品类叫「授权训练语料」。