高质量数据之争:AI与内容提供者博弈.pdfVIP

  • 3
  • 0
  • 约4.57千字
  • 约 9页
  • 2026-04-13 发布于四川
  • 举报

高质量数据之争:AI与内容提供者博弈.pdf

157|高质量数据堪比黄金

欢迎回到《科技参考》,我是卓克。

有人听了往期内容的最新进展之后问,《纽约时报》起诉OpenAI的事

情有没有什么新的进展呢?

具体到这个案件,并没有新的进展,但是这类纠纷在以更剧烈的方式演

化着。

在3月29日,《纽约时报》又发了一份新的声明,不止瞄准了OpenAI,

也把矛头指向了谷歌和Meta。这件事情马上会引发几个行业规则的变

革,都和高质量数据的版权有关。

《纽约时报》这份报告中说,OpenAI使用了一款名为Whisper的语

音识别工具。其实我平时也用这个工具去扒视频字幕,只是为了看字幕

快一点,看视频太浪费时间。

《纽约时报》说,OpenAI用Whisper转录了大量YouTube视频中的

语音部分,然后生成文字,作为文本来训练GPT-4。而且OpenAI也

承认这种做法,还补充说,已经转录了超过100万小时的视频内容。

《纽约时报》说,现在大公司训练AI模型时使用小偷小摸的手段已经

非常普遍了,尽管这些公司都有数据来源合法性的要求,但实际上没有

人执行。这件事谷歌本身也在做,他们也是把YouTube视频内容转成

文字训练大模型。

有些人可能会有疑问,YouTube和谷歌不是一码事吗?不。因为它们

转录的内容并不完全归属于自己,它们也侵犯了视

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档