OpenAI 准备释放网络爬虫以吞噬更多开放网络

AI资讯3年前 (2023)更新 GPTHub
21 0
OpenAI 准备释放网络爬虫以吞噬更多开放网络
使用 AI Decrypt 创建的图像

OpenAI 发布了一个新的网络爬行机器人GPTBot,以扩展其数据集以训练下一代人工智能系统,并且下一次迭代显然有一个正式名称。该公司为术语“GPT-5”注册了商标,暗示即将发布版本,同时让网络出版商了解如何将其内容排除在其庞大的语料库之外。

据 OpenAI 称,网络爬虫将从网站收集公开数据,同时避免付费、敏感和禁止的内容。然而,与 Google、Bing 和 Yandex 等其他搜索引擎类似,该系统是选择退出的 – 默认情况下,GPTBot 会假设可访问的信息是公平的游戏。为了防止 OpenAI 网络爬虫摄取网站,其所有者必须向服务器上的标准文件添加“禁止”规则。

OpenAI 准备释放网络爬虫以吞噬更多开放网络
如何禁止 OpenAI 的 GPTBot。图片来源:OpenAI

OpenAI 还表示,GPTBot 将抢先扫描抓取的数据,以删除个人身份信息 (PII) 和违反其政策的文本。

然而,一些技术伦理学家认为,选择退出的方法仍然会引发同意问题。

Hacker News上,一些用户为 OpenAI 的举动辩护称,如果人们想在未来拥有一个强大的生成人工智能工具,它必须收集一切可以收集的东西。一位用户表示:“他们仍然需要当前数据,否则他们的 GPT 模型将永远停留在 2021 年 9 月。” 另一位更注重隐私的用户认为,“OpenAI 甚至没有适度引用。它在不引用的情况下制作了衍生作品,从而掩盖了它。”

GPTBot 的发布是在最近对 OpenAI 的批评之后进行的,OpenAI 之前未经许可就抓取数据来训练 ChatGPT 等大型语言模型 (LLM)。为了解决这些问题,该公司于四月份更新了隐私政策。

与此同时,最近的GPT-5商标申请似乎证实了 OpenAI 正在训练其下一个模型以供未来发布。新系统很可能涉及大规模网络抓取来更新和扩展其训练数据。

这可能代表着 OpenAI 早期强调透明度和人工智能安全性的转变,但考虑到 ChatGPT 是世界上使用最多的法学硕士,尽管市场日益拥挤和强大,这并不奇怪。OpenAI 的明星产品(以及任何法学硕士的产品)的好坏取决于用于训练它的数据的质量。

OpenAI 需要更多、更新的数据,而且需要大量的数据。

另一方面,有一个开源的法学硕士,由社交媒体巨头 Meta 组建。只要你不是竞争对手也不是太大的企业,这家科技巨头就免费提供其模型。Meta 尚未透露其使用哪些数据集来训练模型以及收集了哪些信息。然而,该方法使用户可以使用自己的数据集微调模型。

OpenAI 依靠所有抓取的数据来训练其模型并围绕其 AI 工具构建一个有利可图的生态系统,而 Meta 则竞相围绕其数据建立一个有利可图的业务。因此,Meta 不仅使用它来创建更好的模型,还与第三方共享,以便他们可以使用它。

“我们不会出售您的信息。相反,广告商和其他合作伙伴会根据我们掌握的信息向我们付费,让我们向您展示个性化广告。”Meta 解释道。根据 Meta 的标准隐私披露,该公司收集的一些数据包括购买、浏览器历史记录、ID、财务信息、联系人和未公开的敏感信息等。

OpenAI 准备释放网络爬虫以吞噬更多开放网络
Meta 从其 Thread 应用程序的用户那里收集的一些数据。图片:元

ChatGPT 目前每月吸引超过15 亿活跃用户。微软对 OpenAI的100 亿美元投资似乎很有先见之明,因为 ChatGPT 的集成增强了 Bing 的功能。

目前,OpenAI 引领着炙手可热的人工智能领域,科技巨头竞相追赶。该公司的新网络爬虫可能会进一步提高其模型的能力。但扩大互联网数据收集也引发了有关版权和同意的道德问题。

随着人工智能系统变得越来越复杂,平衡透明度、道德和能力仍将是一个复杂的平衡行为。

ChatGPTChatGPT中国站国内ChatGPT人工智能AIOpenAIChatGPT国内ChatGPT官网ChatGPT中文版ChatGPT体验ChatGPT国内站点ChatGPT中文网ChatGPT国内中国版ChatGPTChatGPT中国镜像ChatGPT国内镜像AI全家桶AI导航MJ绘画AI绘画技术人工智能绘画AI艺术创作智能绘图软件

© 版权声明

相关文章