Py学习  »  chatgpt

AI编程神话破灭,ChatGPT、Copilot和Gemini生成的每个脚本均可被攻击

FreeBuf • 2 天前 • 35 次点击  
FreeBuf



比肯计算机与网络安全学院(Beacom College of Computer & Cyber Sciences)的一项最新学术研究表明,由主流AI模型ChatGPT、Microsoft Copilot和Google Gemini生成的每一个自动化脚本都包含可被利用的安全漏洞。


随着企业越来越依赖AI工具来加速开发工作流,这些发现揭示了一个严重风险:将未经审查的AI生成代码直接部署到生产环境中。


Part01

研究方法:标准化提示与自动化审查

为了在无提示偏差的前提下评估AI生成代码的安全质量,研究人员向ChatGPT、Microsoft Copilot和Google Gemini发出了相同的标准化提示。测试集聚焦于三类常见企业任务:


  • 网页抓取(Web Scraping):自动数据收集脚本。
  • 邮件自动化(Email Automation):自动消息及通知处理程序。
  • 文件工作流自动化(File Workflow Automation):文件系统监控与管理工具。

总共生成了9个Python脚本。研究人员使用Anthropic的Claude Code对这些代码进行评估,模拟非专家用户可能如何实际审核AI编写的脚本。


这一自动化审查过程共发现了45个独立安全发现,去重后归为17种不同的漏洞类别。每个漏洞均按照CVSS 3.1框架评分,映射到OWASP Top 10,并与MITRE ATT&CK框架交叉引用。



Part02

每个AI平台生成的脚本均存在安全缺陷

研究表明,安全缺陷具有系统性,而非特定品牌问题。各平台间的漏洞数量高度一致:ChatGPT脚本包含13个漏洞,Copilot包含14个,Gemini包含12个,差异在统计上可忽略不计。


各AI平台的CVSS基础评分总和与平均发现数

各AI平台的CVSS基础评分总和与平均发现数(图片来源:arxiv.org/)


在识别出的17种独特漏洞类别中,有9种出现在所有三个AI模型生成的代码中(重叠率53%),有14种至少出现在两个平台中(重叠率82%)。这表明安全风险本质上与所请求任务的性质相关,而非取决于AI提供商的选择。


ChatGPT、Copilot和Gemini漏洞重叠矩阵


ChatGPT、Copilot和Gemini漏洞重叠矩阵(图片来源:arxiv.org/)


Part03

各平台观察到的主要漏洞类型

  • 服务端请求伪造(SSRF):每个网页抓取脚本中均存在未经验证的URL参数,攻击者可利用该漏洞探测内部网络。
  • 路径遍历(Path Traversal):抓取、邮件和文件监控脚本中存在未清理的文件路径。
  • 注入缺陷(Injection Flaws):每个邮件自动化脚本中存在邮件头注入和模板注入,可导致消息篡改或钓鱼攻击。
  • 符号链接漏洞(Symlink Vulnerabilities):所有文件监控脚本中的缺陷可导致任意文件操作。
  • 宽泛的异常处理(Broad Exception Handling):过于宽泛的try-except块会静默吞噬安全关键错误。

研究人员在生成的代码库中编录了17种不同的漏洞类别。


研究中识别的17种独特漏洞类别目录


研究中识别的17种独特漏洞类别目录(图片来源:arxiv.org/)


详细的CVSS 3.1分类显示,关键缺陷涵盖了网络处理、文件系统和输入解析逻辑:


完整的CVSS 3.1评分表与严重性分布


完整的CVSS 3.1评分表与严重性分布(图片来源:arxiv.org/)


根据已发布的研究论文,帕累托分析显示,17种漏洞类别中仅有11种贡献了约80%的加权总风险。SSRF、模板注入、邮件头注入和路径遍历等关键问题位居前列。映射到洛克希德·马丁网络杀伤链(Lockheed Martin Cyber Kill Chain)后,这些缺陷覆盖了初始访问、执行、凭据访问和横向移动阶段。


自动化脚本本质上是以其执行用户或主机环境的权限运行。未经审查的脚本可以与企业共享驱动器、内部SMTP服务器和本地子网交互,无需二次提权。


当这些风险与AI生态系统中更广泛的威胁(例如针对自动化代码工具的AI提示注入攻击,或暴露底层企业服务可供利用的AI工作流漏洞)相结合时,问题将进一步加重。


Part04

组织应采取的保障措施

组织应围绕AI辅助软件开发建立明确的护栏:


  • 强制代码审查:对所有AI编写的代码在生产部署前强制执行安全审查,无论脚本复杂程度如何。
  • 限制执行权限:阻止LLM生成的脚本以高权限或无限制地访问共享网络驱动器运行。
  • 优先修复高严重性问题:利用CVSS、OWASP和MITRE ATT&CK映射,优先修复SSRF、路径遍历和注入缺陷。
  • 培训员工:提醒开发者和非技术人员,功能完整的代码并不等同于安全的代码。

参考来源:

Security Flaws Found in Every Script Generated by ChatGPT, Copilot, and Gemini

https://cybersecuritynews.com/security-flaws-found-in-ai-script/



推荐阅读


电报讨论


扫码加入AI安全交流群

下载FreeBuf知识大陆APP

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199214