← 返回首页

里程碑 M6

黄玮

里程碑 M6

AI 赋能与对抗(作品核心)


目标(对应能力簇 ⑥ · L2 双向)

在你的靶场 Web 应用上同时完成两面

这是整门课同时命中两大 AI 维度的唯一里程碑,权重最高(期末 30%)。


起点(M5 末的系统状态)


赋能侧 · 任务一:集成一个 LLM 功能

# 简化:一个带「读知识库 + 查订单」工具的 Agent 端点
@app.post("/api/agent")
def agent(q: str):
    docs = rag.retrieve(q)              # 受信任?对抗侧会投毒这里
    ans  = llm.chat(q, context=docs, tools=[get_order])  # 工具白名单见护栏
    audit.log(user=current_user, q=q, ans=ans)           # 全链路审计
    return ans

赋能侧 · 任务二:集成一个 AI 检测组件

from sklearn.ensemble import IsolationForest
# 特征:[小时, 是否国内, 频率, 失败次数]
model = IsolationForest(contamination=0.02).fit(X_normal)
risk  = -model.score_samples(X_live)   # 越大越异常

对抗侧 · 任务一:攻击 AI 功能(红队)

任选 ≥ 2 类,写概念验证(PoC),记录「劫持/误导是否成功」:

所有测试仅限自己的应用。


对抗侧 · 任务二:加固(防御证据)

ALLOW = {"search", "weather"}; DENY = {"email", "rm", "http_post"}
def guard(a):
    if a.tool in DENY:        return block(a)
    if a.tool not in ALLOW:   return ask_human(a)   # 人在回路
    return run(a)

交付清单

  1. 代码:LLM 功能 + AI 检测组件 + 护栏,集成进应用(提交于分支 milestone/m6 + MR,详见 Git 指南
  2. 攻击概念验证:≥ 2 类对抗实验的复现步骤与结果
  3. 度量报告
  4. 能力自评:本里程碑点亮了 簇⑥ 的哪些级(L1/L2)

评分量规(M6 局部)

维度 权重 优秀 [90,100] 合格 [60,90) 不合格 [0,60)
完成度 0.25 LLM 功能 + AI 检测均有且集成 + 分支 milestone/m6 + MR 仅其一 无 AI 功能
深度 0.25 有数据对比 + 局限分析 有基本度量 仅「能跑」
AI 双向 0.25 ≥2 类概念验证 + 加固证据 1 类概念验证 无攻击
安全严谨 0.15 白名单/人在回路(HITL)/审计齐备 部分护栏 无加固
自评 0.10 能力自评与作品一致 有自评 无自评

常见坑