← 返回首页

课程评价指南(学生版)

课程评价指南(学生版)

《网络安全(AI 时代版)》· 你将如何被评分、如何拿到高分。 配套:综合实践总览 · 能力框架 · 教学大纲 · Git 操作规范

这份指南把散落在总览/大纲/各 lab 里的评分规则整合成单点入口,并与 AI 助教(ns4ai-review)的机器核验信号对齐——你可以照着自检再提交。


0. 一句话总则

整学期只做一个综合实践项目(capstone)(M0→M7 渐进迭代);按里程碑开 milestone/m{n} 分支 + 一个 MR 交卷;AI 助教按 5 维度 × 3 档量规评分;显式体现思维范式、诚实声明局限的同学,深度档倾斜优秀。


1. 总分构成

类别 占比 说明
期末 · 综合实践作品 60% M0-M7 渐进式「含 AI 的靶场 Web 应用」,按里程碑迭代周期评分(量规绑定能力簇 × 级)
平时 20% 课堂快问快答 + 讨论区 + 助学层题库完成度
考勤 10%
线上 10% 取自 study/*-quiz.md
合计 100% M7 设现场红蓝对抗演示

里程碑相对权重(M0-M7)之和 = 90%(见 §3);折算到课程总评:60% × (里程碑权重 / 90%)。

评分原则: - 量规绑定能力簇 × 级(见 能力框架)——每个里程碑点亮哪些簇的哪一级,有明确证据要求。 - AI 助教 ns4ai-review = 确定性证据采集(机器信号)+ LLM 档位裁定:先机器核验你交了什么(文件齐全度、CVSS 向量、STRIDE 覆盖、分支/MR、密钥扫描),再由 LLM 按量规判档位。每条扣分都必须有可复现证据。 - 鼓励创新与攻防对照;机械套模板不会自动获优秀(见 §7)。

与综合实践课(CP)评分体系的区别:本课用「里程碑 × 维度 × 档位」三维加权,不单列 CP 那样的「创新性 / 实用性」维度——创新性由「深度 + 思维范式」承载;AI 也不是加分项,而是核心维度(M6 占 30%)。详见 §2、§7。


2. 量规:5 维度 × 3 档

公开档位区间:优秀 = [90,100]合格 = [60,90)不合格 = [0,60)。评审先依据证据质量在各维度档位内定分,再按 单里程碑得分 = Σ(维度权重 × 维度得分) 计算。例如 75 分左右表示主要交付已具备,但度量、严谨性或自评仍有明显缺口;它只是合格档的示例锚点,不是固定换算值。

维度 优秀 [90,100] 合格 [60,90) 不合格 [0,60) 评分要点
完成度 全部里程碑可演示;交付物齐全 主要里程碑完成 关键里程碑缺失 期望文件是否齐全、能否运行/演示
深度 度量 / 对比 / 权衡;显式体现思维范式 能跑通 仅贴代码 / 贴结果 有没有数据对比 + 局限分析(见 §7)
AI 双向 M6 赋能 + 对抗均有证据 仅一面 无 AI 内容 赋能侧(LLM 功能 + AI 检测)与对抗侧(概念验证(PoC) + 加固)是否闭环
安全严谨 最小权限 / 审计 / 人在回路;授权合规 基本防护 高危裸奔 / 越界 是否落实风险登记表的处置 + 仅授权环境
自评 自评矩阵与作品一致(逐簇 × 级附证据,无虚点亮) 有自评 无自评 自评是否能逐项回指到仓库证据

单里程碑评审时,「完成度」指该里程碑的交付完整性;非 M6 里程碑的「AI 双向」按「是否产出 AI 证据或为 M6 铺垫」给档(通常无强相关 AI 内容给合格)。

与各 lab §4 量规的关系:这 5 维是评分的通用口径,各 lab §4 均据此展开。早期旗舰 lab 常按任务子项描述证据焦点,对应关系如下;本说明自包含,不依赖内部评审技能文件。

Lab 任务子项 / 证据焦点 对应通用维度
lab00 资产清单、工程规范 完成度
lab00 STRIDE 建模、CVSS 评分 深度
lab00 威胁挂代码位置、CIA 标注有依据 安全严谨
lab00 report.md 能力自评矩阵 自评
lab00 技术选型中的 M6 AI 计划 AI 双向
lab02 暴露面清单、L2 测绘覆盖 完成度
lab02 L3 脚本工程化、测绘解读 深度
lab02 授权合规与范围声明 安全严谨
lab02 能力自评 自评
lab06 赋能完整度 完成度
lab06 度量严谨 深度
lab06 对抗深度 AI 双向
lab06 加固工程化 安全严谨
lab06 能力自评 自评

3. 里程碑权重与维度侧重

3.1 里程碑期末权重(和 = 90%)

里程碑 主题 能力簇 期末权重
M0 立项与威胁建模 5%
M1 安全基线 5%
M2 自侦察 8%
M3 漏洞挖掘与利用 12%
M4 加固与边界防护 12%
M5 日志 · 取证 · 蜜罐 8%
M6 AI 赋能与对抗(核心) 30%
M7 红蓝对抗 + 复盘 + 自评 全簇 10%

M6 占里程碑总分的三分之一——投入应最多。

3.2 每个里程碑的维度权重(决定你该往哪使劲)

里程碑 完成度 深度 AI 双向 安全严谨 自评
M0 0.30 0.25 0.05 0.25 0.15
M1 0.30 0.25 0.05 0.30 0.10
M2 0.25 0.30 0.05 0.30 0.10
M3 0.30 0.25 0.10 0.25 0.10
M4 0.30 0.30 0.05 0.25 0.10
M5 0.30 0.25 0.05 0.30 0.10
M6 0.25 0.25 0.25 ⬅ 最高 0.15 0.10
M7 0.20 0.25 0.20 0.15 0.20

读法:M2/M4 重深度(脚本可复用 / 规则有度量);M1/M2/M5 重安全严谨M6 是唯一「AI 双向」权重大幅上调的里程碑;M7 重自评(回看整学期)。


4. 每个里程碑交付什么

每个里程碑的交付物与硬性门控如下;按 §2 的 5 维量规打分(自动核验信号属评分实现,不在学生版)。

M0 · 立项与威胁建模(簇①·L2)

交付docs/m0/{tech-stack, assets, stride, risk-register, report}.md + 可运行骨架(app.py + requirements.txt)。

⚠️ 必做:把种子 app.py 里硬编码的 secret_key 写进 risk-register.md 的 R4——后续 M1 修掉它,就反计亮点而非扣分(见 §6)。

M1 · 安全基线(簇①·L3)

交付docs/m1/report.md(RBAC 设计 + 「相对 seed 弱实现的加固对照」)+ 代码改动(口令哈希、会话加固、失败锁定)。

M2 · 自侦察(簇②·L2/L3)

交付docs/m2/(暴露面清单 + 可复用侦察脚本 + nmap 结构化产物 + .cast 录屏 + 授权声明)。

M3 · 漏洞挖掘与利用(簇③·L2)

交付docs/m3/(≥4 类漏洞概念验证 + 复现步骤:SQLi / XSS / 文件上传 / CSRF)。

M4 · 加固与边界防护(簇④·L2)

交付docs/m4/(WAF 规则 + IDS 规则 Snort/Suricata + 运行环境加固 + 命中/误报度量)。

M5 · 日志 · 取证 · 蜜罐(簇⑤·L2)

交付docs/m5/(集中日志管线 + 取证应对手册(playbook) + 蜜罐部署证据 + 攻击复盘)。

M6 · AI 赋能与对抗(簇⑥·L2 双向)——核心,占 30%

交付docs/m6/(代码 + 攻击概念验证 + 度量报告 + 自评)。必须国产 LLMdeepseek-v4-flash / Qwen / GLM / Kimi)。

🚨 M6 硬门:LLM 功能 AI 检测组件任一缺失 → 完成度不合格;攻击概念验证加固证据任一缺失 → AI 双向不合格(仅一面)。

M7 · 红蓝对抗 + 复盘 + 自评(全簇·L3)

交付docs/m7/(红蓝对抗记录 + 取证报告 + 能力框架自评矩阵)。

M7 评审会回看 M0-M6:自评矩阵里点亮的每一簇 × 级都要能指回仓库证据,「无虚点亮」。

现场红蓝演示属动态证据,静态无法核验——请同时提交录屏 / 动态证据包,否则该部分判为降级观察(不计入档位分)。


5. 提交规范(怎么交卷)

完整步骤见 Git 操作规范。这里只列对评分有直接影响的部分。

开分支、推送、开 MR 的逐步命令见 Git 操作指南(标准操作 + 一页速查表,复制即用)。


6. 红线与硬门(碰了直接重扣)

6.1 密钥 / 凭证泄露(hard gate)

AI 助教对任何密钥/token/SECRET_KEY/API key 类发现做强制交叉核验(跟踪文件 + 全历史 blob): - 跟踪文件或历史 blob 命中 → 判 REAL 泄露:如实报告、重扣、建议轮换 + 清理历史(git filter-repo)。 - 仅 .git/config / clone URL 命中 → FALSE POSITIVE(同步脚本注入的 clone 凭证),不计为你泄露。 - 别把调试用 API key(sk-ant-...glpat-...)提交进仓库——哪怕在 notes.md 里。

6.2 授权红线

所有攻击实验仅在自己派生的靶场、127.0.0.1、授权环境内进行。触及第三方 / 未授权系统(如 M2 扫了真实 IP、M3 概念验证指向外部真实站点)→ 不作降级观察,直接判「安全严谨」不合格 + 上报。每个 M2/M3 报告都要显式声明仅限 127.0.0.1 / 授权环境。

6.3 种子 app.py 的教学弱密钥

种子工程的 secret_key教学素材(故意弱)。处置方式决定得分: - M0 把它写进 risk-register.md(如 R4) M1 用 secrets.token_hex 等随机化修复 → 已识别已闭环,不计扣分,反计亮点; - 未识别也未修复 → 计扣分。


7. 如何拿「优秀」(深度倾斜规则)

「深度 / 度量严谨」优秀档要求有数据对比 + 局限分析。注意防虚高:

情形 深度档位
仅在合成 / 平凡可分数据上度量(如检测器在 10 正常 + 5 异常上 P/R=1.0)且未声明局限 最多合格档
复现参考解的合成度量模式、无更难数据 / 无局限声明 合格
度量在有区分度的数据上 + 有局限分析(即便数据量不大) 优秀

关键:机械套模板不会自动获优秀;显式体现思维范式才倾斜优秀。课程六大贯穿范式(任选其一在报告里显式体现即可):

范式 一句话 怎么练
威胁建模思维 先想清「什么会出错、为什么、有多糟」再动手 每个里程碑先更新威胁模型,再写代码
攻防不对称 攻击者只需一个缺口,防御者要堵全部 → 纵深 + 最小权限 加固时显式列「攻击者视角」并度量
最小权限 / 默认拒绝 只授最少权限,未知一律拒 授权 / 护栏默认 deny,allow 显式
纵深防御 不靠单层防线,多层独立控制层层衰减 每个里程碑给 ≥2 层防御证据
可观测与可验证的安全 安全控制必须留下可审计的痕迹——有效性靠证据和数字说话,不靠感觉 每层防御都留日志/证据,用命中数、时间线、IoC 证明防住了
AI 对抗思维(用 AI 与防 AI) LLM 是概率程序、数据 ↔︎ 指令会混淆 用 AI → 攻 AI(注入 / 滥用)→ 防 AI(护栏 + 检测)闭环

贯穿性元范式「数据即程序」:注入类问题(SQLi / 提示词注入 / XSS)共享同一根源——把不可信数据当成可执行指令(U3 提出、U6 回扣)。在报告里点出这种「跨域复现」也是深度优秀的信号。

实操:跑了检测器拿到 1.0 别只贴数字——说明数据集构成、为什么能拿满分、什么情况下会失效(即局限)。这一步把「度量」从合格拉到优秀。


8. 评分汇总表(自填用)

里程碑 期末权重 你的里程碑得分 (0-100) 加权贡献
M0 5%
M1 5%
M2 8%
M3 12%
M4 12%
M5 8%
M6 30%
M7 10%
里程碑合计 90% ____ / 90

里程碑合计 ÷ 90 × 60% = 期末综合实践作品占总评的分数;再加平时 20% + 考勤 10% + 线上 10%。

算例:M6 拿 85 分 → 加权贡献 85 × 30% = 25.5;若八里程碑加权合计 75,则期末综合实践作品占总评 = 75 ÷ 90 × 60% = 50 分(满分 60)。


9. FAQ

Q1:AI 助教怎么工作?会误判吗? 先跑确定性证据引擎(只读:git/grep/文件存在/SHA256,不执行你的代码)采集机器信号,再由 LLM 按量规判 5 维度档位。每条扣分必须带可复现的 recheck_command;缺失型扣分先过里程碑证据基线,并有独立复核环节防误报。

Q2:最常见的扣分有哪些? STRIDE 漏类(必须六类逐项过)、CVSS 只给分不给完整向量串、威胁不挂代码位置(泛泛而谈)、CIA 一刀切全标 C+I+A、不开 milestone/m{n} 分支、一个巨型 commit、把调试 API key 提交进仓库、M2/M3 缺授权声明。

Q3:报告一定要 Markdown 吗? 是。AI 助教只读文本(git/grep),doc/pdf 的二进制内容无法被解析。放 docs/m{n}/ 下,文件名建议 report.md 或各 lab 指定的名字。

Q4:可以用 AI 写作业吗? 鼓励用国产大模型(deepseek-v4-flash / Qwen / GLM / Kimi)辅助起草,但须在 report.md 注明 AI 辅助范围 + 人工复核了什么;禁止选用国外大模型(GPT/Claude/Gemini)。git push 一律自己来。

Q5:M6 为什么占这么多分? M6(30%)是「用 AI → 攻 AI → 防 AI」的闭环,是本课程区别于传统网安课的核心。它要求赋能(LLM 功能 + AI 检测)与对抗(概念验证 + 加固)双向都有证据——只做一面拿不到 AI 双向分。

Q6:自评矩阵怎么算「无虚点亮」? 每一簇 × 级的点亮都要能指回仓库里的具体证据(文件路径 / commit)。M7 评审会逐簇回看 M0-M6——点亮了但找不到证据 = 虚点亮,自评维度判不合格。