Anthropic宣布推出500万美元研究资助计划评估AI对福祉的影响

Anthropic 官方宣布推出一个 500 万美元的资助计划,旨在资助独立研究,探讨人工智能(AI)对用户福祉的影响。该计划将为获资助者提供直接资金、访问其模型的权限以及技术支持,协助建立开源评估,帮助 AI 行业衡量其模型对用户的影响。

资助计划的目的和重要性

Anthropic 表示,AI 系统已成为许多人工作、学习和解决问题的核心工具,并且在困难时期也成为了对话伙伴和情感支持的来源。然而,整个行业仍在努力制定明确的标准,以确保模型在这些对话中的行为恰当。

「我们希望通过资助独立的评估和基准,邀请更多人参与这个新兴且关键的领域,包括临床医生、心理学家、方法论专家等。」

Anthropic

评估福祉的挑战

评估福祉是一个特别困难的领域。大多数模型行为的评估可以通过单一答案来确定其准确性和适当性,但福祉的评估需要更多的背景。例如,一位处于困境中的用户可能不会立即分享自我伤害的想法,而需要在长时间的对话中逐步显露出来。

「正确的应对方式需要随着我们的模型及其使用情况的演变而不断发展。」

Anthropic

资助计划的具体要求

在这个资助计划中,Anthropic 将分享其安全保障团队的指导,明确什么样的福祉评估是足够严谨的。评估需清楚说明测量内容,涉及临床和主题专家进行设计和验证,并反映用户实际使用 AI 的情况。

「我们寻求的评估应该能够测试预防措施和危害,包括评估过度遵从和过度拒绝的风险。」

Anthropic

有意申请的研究者可通过官方网站获取申请表,截止日期为 9 月 21 日,选中的申请者将于 10 月 5 日收到通知。

资料来源:Anthropic 官方公告

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep