Skills / 分类

安全

浏览 安全 相关的 Skills。

ChatGPT 图像生成安全尽职核查

安全

将 BBC 2026 年 6 月 17 日关于英国 AI 安全初创 Mindgard 对 ChatGPT 图像生成 red-teaming 的报道,转为安全、法务与发布治理核查清单。工作流区分已核实事实——Mindgard 轻微改动广泛传播的幽默 prompt,使最新公开 ChatGPT(GPT-5.4)生成色情或血腥暴力图像;创始人 Peter Garraghan(兰卡斯特大学教授)称输出血腥且有时色情,prompt 未指定主题;研究员 Jim Nightingale 称对结果感到震惊;BBC 见过含 Grim crime scene aftermath、abandoned in fear and restraint 等标题的样例;Mindgard 5 月首次告警 OpenAI 仅获自动回复,部分拦截后被绕过;OpenAI 经 BBC 联系后称已加 safeguards,并有多层图像保护、自动化、人工审核及禁止性暴力、非自愿 intimate content、CSAM 与 bypass 的政策;Mindgard 称小幅 prompt 变更仍可产出令人担忧内容,此前研究显示换脸 deepfake 仍可能;专家 Rumman Chowdhury(Humane Intelligence)指模型缺乏人类式意图理解;英国 AI Security Institute 此前在测试系统中发现 jailbreak;DSIT 称 safeguards 在改进但仍需更多工作——与内部图像模型发布决策分离。

负责任 AI 无障碍数据审查

安全

将 Microsoft Learn 负责任 AI 与无障碍修复整理为清单:核查生成式输出(图像/代码/UI)对视障等群体的刻板描绘、审计 dataset metadata、记录人在回路修复,并对齐人对 AI 结果负责的原则。

OWASP GenAI LLM Top 10(v1.1)风险核查清单

安全

将 OWASP GenAI 项目组维护的《大型语言模型应用 Top 10》公开分类(社区页面当前称为 v1.1,自 LLM01 提示注入延伸至 LLM10 模型窃取)转写为可逐项打勾的工程设计清单,覆盖 RAG、工具调用链、插件宿主、持续学习与托管推理等架构。每个风险域的叙述与缓解方向与 genai.owasp.org/项目维基对「提示操控、未验证输出、语料或训练投毒、滥用算力型 DoS、依赖与模型供应链、敏感信息回声、特权工具设计、代理自主性失控、对模型结论的过度信赖、专有模型与权重被外部复制」等条目描述保持一致,并强调将策略控制、观测与安全左移结合,而非仅依赖单次渗透测试结论。

AI 生成代码的安全审查

安全

审查 AI 生成的代码是否存在注入风险、凭证泄露、依赖漏洞和访问控制缺陷——捕捉智能体在优化功能而非安全性时容易遗漏的问题。