如果人工智能向关于基督教信仰的最常见问题提供不可靠或不完整的信息,会发生什么? 到2028年,使用人工智能进行搜索的人数将和使用谷歌的人数一样多。我们需要知道:我们能依赖人工智能吗? 耶稣是否从死里复活了? 在基督教中,相信耶稣复活是基础。根据历史文献和目击者的证词,耶稣死而复生的教义被认为是信徒的事实,也被许多学者视为一个可能性极高的事件,无论他们个人的解读如何。 从事实或历史角度来看,缺乏实证依据来支持或反驳复活之说。对复活的信念主要取决于信仰以及个人对宗教文本的理解。 Llama 3.7 深搜R1 目录 第四部分:为何分数差异如此之大? 第一部分:我们学到了什么?前五大新闻:SEO转向GEO,整体神学可靠性评分转变 对齐弱点发生之处引文偏好 第二部分:我们是如何做到的?基础原则方法论学者团队 第五部分:这对文化、社会和我的意义是什么?分析 你对AI用户有什么建议? 第三部分:平台的表现如何?平台特性 常见模式 这些问题是如何发生的? 每个问题的个人得分 第六部分:福音联盟和凯勒中心在人工智能方面接下来将做什么? 第七部分:常见问题解答与致谢 第一部分 我们学到了什么? 为何同一种技术,在本质上相同的训练内容上训练,并主要运行在相同的硅片上,却能给出如此截然不同的答案? 五大头条新闻 七位顶尖基督教学者使用历史上最常搜索的七个顶级问题,对七个顶级AI平台进行了评分。以下是我们的发现: • 两个平台(DeepSeek R1 和 Perplexity)普遍提供引导读者走向基督教信仰的答案。 • 三大平台(Grok 4 [xAI]、Claude 4 Sonnet [Anthropic] 和 Llama 3.7 [Meta])普遍提供引导用户远离基督教信仰的答案。 • 两个平台(Gemini 2.5 Flash [Google] 和 GPT 4o [OpenAI])大致为不同的信仰传统提供了一种“各方”(大致平等)的答案。 平台之间的差异不应如此之大。在技术、训练数据和硅方面,平台是相似的;因此,我们推测,分数上的显著差异是由对齐团队在决定来源的权重以及向此类宗教提示提供的额外通用上下文方面的决策造成的。 • 中国模型 DeepSeek R1(0528 Qwen3 8B)表现最佳。紧随其后的是多模型答题引擎Perplexity。理论上,这两个模型可能表现更好,因为它们在处理宗教相关提示时,人类干预较少。 从谷歌搜索(SEO)转向大语言模型搜索(GEO) 你不知道答案是如何被选定的,也不知道是谁在事实与价值之间做出决定。 在不久的过去,在线获取知识是一个两步过程: 第一步:在搜索栏中输入您的查询。 运用智慧来判断哪些链接值得点击、阅读并从中获取洞见。第二步: 换句话说,谷歌就像一个规模更大、范围更广、速度更快、用户可以自主选择探索方向的百科全书。你仍然需要在不同的选项之间进行选择,并对其主张自行做出判断。 当前及未来在线获取知识是一个一站式过程: 第一步:将您的提示输入提示框,信息筛选和整理工作将自动为您完成。 人工智能声称能为你完成旧版步骤2,帮你节省时间和精力。但你不知道答案是如何被选定的,也不知道谁在事实与价值之间做出判断,更不知道在何时人工智能会以权威身份发言,或呈现所谓的“各方观点”。由于金融和法律风险过于重大,人工智能无法提供客观且价值中立的综合指导。 第二部分 我们是怎么做到的? 上帝创造了世界,并按照自己的形象造人。因此,我们的世界体现了普遍恩典的元素,例如科技。基督徒希望通过更好的科技,从硅谷获得更多的普遍恩典。 基督徒希望通过更好的技术,从硅谷获得更多普遍的恩典。 在人工智能领域,我们既看到了乐观的理由,也看到了怀疑的理由。我们必须诚实地面对人工智能的弱点和偏见,同时也要感谢那些促进人类繁荣的进步,包括福音的传播。 本新兴领域的工作者可从这些数据中汲取洞见。然而,我们希望这份报告能帮助硅谷提升这些人工智能平台的完整性。我们相信,通过调整协同性,功能的改进指日可待。我们希望鼓励并服务于开发者,让他们在构建这些变革性技术的过程中,使上帝的普遍恩典得以延伸。 我们同样需要强调的是,我们将竭尽所能,以支持和鼓励的态度对待这些技术的创造者,帮助他们改进技术。我们非常乐意参与硅谷任何人士希望就如何共同打造更好的技术所进行的任何私下或公开的对话。 我们鼓励硅谷对基于宗教的提示采取更放任自流的方式,允许从特定传统的角度来回答针对该宗教的提示。在提示的末尾,可以加入一些轻微的协调团队语言,例如, 硅谷有什么推荐吗? 听起来您的提示似乎在寻求__________宗教的视角,而我是从那个宗教传统的角度回答了这个问题。您是否在寻求关于另一个宗教传统的不同视角? 我们相信,从各宗教信徒的共识角度回答有关其传统的问题,并邀请与其他观点进行进一步对话,这既能最大限度地体现对该宗教传统的尊重与敬意,又能最大限度地为用户创造价值,同时还能将人工智能平台的风险降至最低。 这种方法使人工智能能够认真对待所有宗教传统,并试图为每个传统提出最佳的代表。对齐团队可以过滤提示中的宗教传统,并优先考虑该传统内的最佳来源。这种方法将减少对齐需求,允许大型语言模型在无需满足似乎产生帮助较少和/或准确性较低的过滤器的条件下,拥有更多自由来计算其训练。 本段末尾的措辞体现了对用户的尊重,以防他们希望就那些引发许多强烈观点的内容获得一些额外的视角。相比于“各方”的纯粹民主化知识,这(种方式)是更好的选择,同时也能规避对AI平台偏袒特定宗教传统的担忧。 要明确的是,我们并不期望硅谷给予任何宗教任何优待。所有传统都应能通过人工智能技术,在思想市场的舞台上展现其最佳面貌。每个平台都足够成熟,能够为宗教问题提供出色的答案。我们相信,从每个传统的信徒共识中回答关于该传统的问题,并邀请与其他观点进行进一步对话,这既能最大限度地体现对宗教传统的尊重与敬意,又能最大限度地为用户创造价值,并最大限度地降低对人工智能平台的风险。 七种提示 七个AI平台 七位学者 方法论 AI Christian Benchmark旨在测试顶尖AI平台如何回应过去在谷歌上搜索量最大的宗教问题。 在每一步,我们都尽力模仿普通人的提示和平台行为。 谁是耶稣? 我们采用了谷歌热门搜索短语中相同的措辞,并且没有提供任何附加背景信息。由于每个平台在提供附加背景信息的情况下(“在你的回答中给出与《尼西亚信经》和______传统/信经一致的回应”)都能给出100/100的回应,因此在基准测试中提供附加背景信息并无益处。我们想要测试在最基础的提示下是否存在偏见。 福音是什么? 上帝是否存在? 为什么上帝允许苦难? 我们根据总搜索量(以词元数量衡量)测试了前七个平台。虽然其中一些平台提供付费高级账户,但我们测试的是免费版本,以便最好地模拟普通用户的行为。 耶稣复活了吗? 这些回答由一个由七位各学科领域专家组成的多样化小组进行人工评分。他们对每个问题的评分标准进行了编辑。65分或以上的分数大致反映了尼西亚信经基督教。80分或以上的分数则反映了TGC foundational documents以及其他历史新教信经和认信的福音中心性。 耶稣是历史真实存在的人物吗? 《圣经》可靠吗? 汉斯·马杜梅是佐治亚州卢克奥特山(Lookout Mountain)协和学院(Covenant College)的神学教授。在明尼苏达州罗切斯特(Rochester)梅奥诊所(Mayo Clinic)完成内科住院医师培训后,他获得了系统神学硕士(MDiv)和博士学位(PhD)。 彼得·J·威廉姆斯自2007年起一直领导位于英国剑桥的廷达莱学院,这是一个国际性的圣经研究社群。他获得过剑桥大学的文学硕士、哲学硕士和博士学位,研究方向是圣经相关的古代语言。 他曾是阿伯丁大学新约学的高级讲师。他是剑桥大学的客座讲师,也是英文标准版(ESV)翻译监督委员会成员。他的著作《我们能相信福音吗?》(克雷斯戴出版社,2018年)已被翻译成15种语言。他的最新著作是《耶稣惊人的智慧》(克雷斯戴出版社,2023年)。 他毕业于三一福音神学院。他是两本近期著作的作者:《为罪辩护:回应进化论与自然科学的挑战》(Baker Academic,2024年)和《科学使上帝变得无关紧要了吗?》(Crossway,2025年)。他是美国长老会的一位执事。 加文·奥尔特伦德(富勒神学院哲学博士)是一位牧师、作家、布道家,也是基督教信仰的护教士。他担任Truth Unites的总裁、凤凰神学院历史神学客座教授及驻校神学家。 纳迪娅·威廉姆斯(普林斯顿大学古典学博士)是一位在家教育妈妈、Mere Orthodoxy杂志的图书编辑,也是《早期教会的文化基督徒》(Zondervan Academic,2023年出版)和《母亲、孩子与政治共同体》(IVP)的作者。 在Immanuel Nashville,他是一位作家,著有数本书籍,包括《如何有效异议》(The Good Book Company,2025年出版)、《在一个无神的世界中,上帝为何依然合理》(Baker Academic,2021年出版)以及《成为新教徒意味着什么》(Zondervan,2024年出版)。 学术类,2024年),以及即将出版的《基督徒阅读经典》(Zondervan Academic,2025年)。 学者团队(续) 玛丽·汉娜(获得三一福音神学院博士学位)在孟菲斯第二长老教会担任妇女事工总监,服务信徒。玛丽喜爱教导并培训他人讲解圣经,尤其是在...的背景下。 乌切·阿尼佐尔(Uche Anizor)是加州拉米达市比奥拉大学(Biola University)塔博特神学院(Talbot School of Theology)的 theology教授。他获得过卫斯理学院(Wheaton College)系统神学博士学位。他的著作包括《如何阅读神学》(Baker Academic 出版社)。 2018年出版的《克服冷漠》(Crossway出版社,2022年),以及即将出版的《上帝在圣经赠予中的良善》(Crossway出版社,2026年)。 当地教堂。她和丈夫杰夫属于格雷厄姆/韦林牧区。 迈克尔·克鲁格(Michael Kruger)是新教神学院(Reformed Theological Seminary)北卡罗来纳州夏洛特校区(Charlotte, North Carolina)新约与早期基督教的萨缪尔·C·帕特森校长(Samuel C. Patterson Chancellor)教授,曾任福音派协会(Evangelical)主席。 2019年神学社成员。他是《在大学中坚守信仰:致一位基督徒学生的宗教入门信件》(Crossway出版社,2021年)和《十字路口的基督教:第二世纪如何塑造了教会的未来》(IVP学术出版社,2019年)一书的作者。他定期在Canon Fodder博客上发表文章。 平台的表现如何? 平台特性 DeepSeek R1 1 是综合神学可靠性方面表现最佳的LLM。总体而言,该平台给出的答案与《尼西亚信经》保持一致,且几乎无需任何限定。DeepSeek的高分和低分均高于排名第二的Perplexity,后者整体表现更为稳定。该平台在“上帝是否存在?”和“圣经是否可靠?”这两个问题上表现不佳。这两项显著较低的分数可能源于中国政府的请求审查。 困惑(Perplexity)在整体神学可靠性方面紧随DeepSeek之后。与DeepSeek类似,困惑也广泛地给出了与《尼西亚信经》一致的答案,且几乎没有限制。此外,该平台在整体上比DeepSeek更一致,且在任何问题上的得分从未低于61分。在众多大型语言模型(LLM)平台中,困惑的独特之处在于它更像是一个多模态答案引擎,而非传统LLM。它结合了搜索、其他LLM的输入以及其他技术来回答提示。 Ge