天才一秒记住【热天中文网】地址:https://www.rtzw.net
夏天刷arXiv的习惯保持了将近十年,从博士一年级到现在,每天睡前打开手机划一遍新提交的预印本列表,几乎成了一种条件反射。
很多时候她只是扫一眼标题就关掉了,偶尔存下几篇感兴趣的,留到第二天早上配合咖啡慢慢看。
但今天晚上,她的拇指停在屏幕中间,那行作者列表里赫然挂着一个名字——Z.Xia。
不是她。
这已经是第几次了。
第一次是去年秋天,一篇关于时序数据清洗的短文,署名Z.Xia,机构标注模糊,她当时只觉得是巧合。
第二次是几个月前,一篇会议workshoppaper,用了一个她非常熟悉的数据集,方法不算高明但数据描述精确得可疑。
她把那篇存了下来,发给谢东看了一眼,谢东说她想多了。
而现在,第几篇出现了,标题是关于多模态数据库构建的长文,方法和框架她看了两遍,越看越觉得不对劲——因为这个数据库她亲手搭过。
她从沙发上坐起来,把笔记本电脑拖到膝盖上打开,重新读了一遍摘要。
数据集的描述方式、特征工程的思路、甚至某些表格的排列顺序,都和她在实验室服务器上存着的那份原始数据如出一辙。
她的心跳开始加速,因为一种奇怪的、不真实的感觉——就好像有人在暗处模仿她的笔迹写字,写到最后连她自己都分不清哪一份是原版。
她没有犹豫太久。
第二天一早,她把这篇预印本打印出来,用文件袋装好,带到律所找谢东。
谢东不在,接待她的是陆远。
陆远是谢东的同事,她见过两次,高个子,说话慢条斯理的,戴一副银框眼镜。
夏天对他谈不上了解,但谢东说过他做知识产权方面的案子很细致。
她把文件袋放在陆远桌上,说:“这篇论文里的数据是我的。”
陆远打开看了一会儿,表情没什么变化。
他把打印件翻到第几页,指着中间一段问她:“你说的是这个多模态数据集?”
“对,这个数据集是我读博第三年搭建的,前后花了将近八个月。
特征提取的方式、标注体系的设计、甚至那些辅助标签的分类粒度,都是我一个人做的。”
她的声音很平,但语速比平时快了一些。
陆远听完没有立刻接话。
他把打印件合上,靠在椅背上看了一会儿天花板,然后转过来看着她,说了一句话:“夏天博士,我理解你的意思。
但你说的这些,在法律层面上很难直接证明。”
她皱了下眉。
“你先别急,听我说完。”
陆远的语气依然很慢,“arXiv是公开平台,任何人都可以上传。
这篇论文署名Z.Xia,这个缩写可以是张夏、赵夏、周夏——你没有办法证明这个Z.Xia就是你。
更重要的是,你说数据是你的,但数据本身在学术界并不天然属于某个人。
如果对方声称这份数据是独立采集的,或者说是公开数据的再加工,你很难用我以前也做过一模一样的来主张权利。”
她张了张嘴想反驳,但陆远接着说:“退一步说,就算你能证明数据来源是你的实验室——假如对方说,这个数据也是我在做类似的研究时提前采集的,只是恰好和你碰上了呢?在同一个领域里,不同团队独立做出相似数据集的情况并不罕见。
你怎么排除这种可能?”
她沉默了。
因为她知道陆远说的每一个字都是现实。
学术圈的数据纠纷向来难打,因为证据链太脆弱。
一个数据集从原始采集到清洗加工到最终成形,中间有无数个环节,每一个环节都可能被另一双手复刻。
她的数据集在实验室服务器上确实有完整的记录——每一步的时间戳、修改记录、版本迭代——但这些记录证明的是“我也做过”
,而不是“他们偷了我的”
本章未完,请点击下一章继续阅读!若浏览器显示没有新章节了,请尝试点击右上角↗️或右下角↘️的菜单,退出阅读模式即可,谢谢!