长三角安全人工智能实验室发布星界、星驭、星鉴三大AI安全方案
三大方案亮相合肥,瞄准AI安全痛点
2026年9月19日,第一届中国网络空间安全大会(CCSC 2026)在安徽合肥举行。其中一场由长三角安全人工智能安徽省实验室承办的专题论坛,聚焦“人工智能安全与应用治理”,现场发布了三套新方案:星界、星驭和星鉴。这三套系统分别对应大模型内容安全、智能体应用安全和AIGC内容可信传播,试图覆盖当前AI技术从开发到落地过程中最突出的安全风险。

实验室主任刘俊华在演讲中提到,AI技术跑得越快,安全问题就越不能拖后腿。过去几年,他们一边做技术攻关,一边把能力产品化,现在已经能支撑日均数亿次的安全调用,并在25个私有化项目中落地。这次发布的三大方案,算是把积累的经验打包成可复用的工具箱。

星界:给大模型装上“安全护栏”
大模型的问题,往往从数据就开始埋雷。星界方案的第一步,就是在训练前对数据做清洗,剔除明显违规或偏激的内容,同时通过价值对齐机制,让模型在底层逻辑上更“守规矩”。这不是一次性的动作,而是贯穿整个生命周期。
到了模型上线阶段,星界会部署实时内容安全护栏。比如用户输入一个诱导性极强的提示词,试图绕过限制生成违法信息,系统能立刻识别并拦截。它还能区分不同行业的合规要求——医疗场景对隐私敏感,教育场景对价值观敏感,汽车座舱对指令准确性敏感——星界会根据部署环境动态调整策略。
运行一段时间后,系统还会自动监测异常行为,比如某类请求突然激增,可能意味着新型攻击出现。这时候人工研判团队介入,快速优化规则,形成闭环。整个过程都有安全评测平台支撑,定期对模型做压力测试,确保防护能力没掉队。
目前这套方案已经用在讯飞星火大模型上,也支持其他开源或闭源模型,既能云上部署,也能私有化落地,适配央国企等对数据隔离要求高的客户。
星驭:管住“乱跑”的智能体
大模型只是大脑,真正干活的是智能体(Agent)。但智能体一旦失控,后果可能比模型输出错误更严重——比如擅自调用支付接口、越权访问数据库,甚至执行完全偏离任务目标的操作。
星驭方案的核心思路是“先明确身份,再授权行动”。每个智能体在启动前都要注册身份,绑定权限范围和可调用的工具集。上线前,系统会对它依赖的Skill(功能模块)做安全扫描,查有没有供应链漏洞。接着放进安全靶场,用自动化红队模拟真实攻击,看它会不会被诱导执行危险操作。
运行过程中,星驭全程盯住“输入—规划—执行”三个环节。如果用户输入恶意指令,或者智能体自己规划出越权路径,系统会分级处置:轻则告警,重则直接熔断。所有操作都会留痕,事后能回放完整链路,方便审计和溯源。
这套方案特别适合金融、政务和智能办公场景。比如银行里的客服智能体,既要高效回答问题,又不能泄露客户信息或擅自转账。星驭还能帮企业管好内部的Skill仓库,确保新开发的功能模块在入库前就通过安全自检。
星鉴:让AIGC内容“可验可溯”
现在随便一个App都能生成图片、视频、语音,但没人知道内容是不是AI做的,更不知道是谁做的、为什么做。星鉴方案想解决的就是这个信任问题。
它的做法分两步:一是主动标识,二是否认检测。对于自家平台生成的内容,星鉴会嵌入隐式数字水印,肉眼看不见,但机器能读取,相当于给内容发“身份证”。对于来源不明的内容——比如社交媒体上疯传的一段视频——系统会先判断是不是AI生成的,再检测有没有深度伪造痕迹,最后结合上下文判断是否存在违规风险。
这套技术覆盖文本、图像、音频、视频四种模态。新闻机构可以用它验证投稿是否为AI代写,社交平台能自动标记可疑内容,版权方则能通过水印追溯侵权源头。实验室还承建了工信部首个AIGC生成检测处置平台,说明这套方法已经过了官方验证。
有意思的是,星鉴并不只靠单一技术。比如检测一张AI生成的人脸图,可能同时用到纹理分析、光照一致性判断和元数据分析,综合打分才下结论。这样能减少误判,避免把真人照片错标成伪造内容。
安全不是成本,而是新机会
刘俊华在演讲中反复强调一点:AI安全治理不再是“不得不做”的合规负担,而是一个快速增长的市场。随着大模型和智能体在各行各业铺开,企业愿意为可靠的安全方案买单。实验室过去三年积累的技术,现在正通过产品化快速变现。
但挑战也在升级。攻击者也在用AI对抗AI,比如用对抗样本绕过检测,或者用多轮对话逐步诱导智能体越权。这意味着安全方案必须持续迭代,不能一劳永逸。刘俊华呼吁行业保持开源开放,共享威胁情报和防御经验,一起把生态做厚。
从这次发布的三大方案看,实验室的策略很务实:不讲宏大叙事,而是针对具体场景拆解风险,给出可落地的工具。星界管内容输出,星驭管行为执行,星鉴管传播链条——三者拼起来,刚好构成AI应用从内到外的安全闭环。
未来,随着多模态模型、具身智能等新技术出现,新的安全问题还会冒出来。但至少现在,有人已经开始认真搭防护网了。