OpenAI推网络安全防御体系,Qwen 2.4T模型部署教程上线

0 阅读

OpenAI 动员250人构建网络安全防御体系

OpenAI最近公开了其内部网络安全项目 Defense Factory 的详细架构和实践手册。该项目动员超过250名员工,覆盖公司内部数百个系统,目标是通过专用网络安全模型持续发现、验证并修复潜在漏洞。

大黑

与传统依赖人工审计或规则引擎的方式不同,Defense Factory 引入了基于大模型的自动化漏洞扫描机制。这些模型能理解代码语义、系统交互逻辑甚至业务上下文,从而识别出常规工具容易忽略的逻辑缺陷或权限绕过风险。例如,在一次内部测试中,模型发现了一个身份验证服务中的时序竞争漏洞——该漏洞仅在特定请求顺序下触发,此前多次人工审查均未察觉。

OpenAI强调,这套体系并非取代安全工程师,而是将其从重复性扫描任务中解放出来,专注于高价值的威胁建模与响应策略设计。目前,相关工具链和部分训练数据已开源,供社区参考。

AWS 发布 Qwen3.8-2.4T 超大模型部署指南

阿里云推出的 Qwen3.8 系列中,参数量达2.4万亿的 A95B 版本因其规模成为工程部署的挑战。AWS近日在官方博客发布了使用 vLLM 在 SageMaker HyperPod 上部署该模型的完整教程。

HyperPod 是 AWS 专为大规模分布式训练和推理设计的基础设施,支持数千张 GPU 的高效互联。教程详细说明了如何配置集群拓扑、优化通信带宽,并利用 vLLM 的 PagedAttention 技术减少显存碎片。实测显示,在8节点(每节点8张 H100)配置下,Qwen3.8-2.4T 可实现每秒约12个 token 的吞吐量,延迟控制在可接受范围。

值得注意的是,该部署方案主要面向具备超大规模模型运维能力的团队。对于普通开发者,阿里云仍推荐使用 API 或较小版本的 Qwen 模型。AWS 也提醒,此类部署需仔细规划成本,单次推理的资源消耗可能远超预期。

Cognition 公开 RSA-260 分解的 GPU 优化方法

密码学领域迎来新进展:Cognition 实验室披露了其参与 RSA-260 大整数分解的技术细节。RSA-260 是一个260位十进制数(约863比特),属于经典公钥密码挑战的一部分。此前类似规模的分解通常依赖 CPU 集群和复杂的分布式筛法,耗时数月且成本高昂。

Cognition 团队开发了一套 GPU 优化的格基约化(lattice basis reduction)算法,大幅提升了筛法阶段的效率。他们利用 GPU 的高并行计算能力,重新设计了多项式选择和关系收集的流程,将整体计算成本降至传统方案的约十分之一。据称,整个分解过程在数百张 A100 上运行不到三周。

虽然 RSA-260 并非当前主流加密标准(现代 TLS 通常使用2048位以上密钥),但该成果展示了 GPU 在数论计算中的潜力。Cognition 表示,Devin(其AI工程师)在算法调优和代码生成中发挥了关键作用,特别是在 CUDA 内核优化方面。

Claude Fable 5.1 写作风格更趋简洁

评测平台 Arena 基于数万条高推理负载下的输出样本,对比分析了 Claude Fable 5 与 5.1 版本的写作风格变化。结果显示,新版在多个维度上进行了调整。

最明显的是减少了“附和式”开场白,如“这是一个很好的问题”或“您提到的点非常重要”。同时,破折号的使用频率下降了近40%,模糊限定词(如“某种程度上”“可能”“一般来说”)也显著减少。取而代之的是更直接的陈述和结构清晰的段落。

有趣的是,尽管语言更精炼,回答的中位长度却从318词提升至414词,增幅约30%。这表明模型并非简单删减内容,而是在去除冗余表达的同时,增加了实质性信息密度。Arena 认为,这种变化使 Claude 在技术文档、代码解释等场景下的实用性更强。

LangChain 接入 Browserbase 构建网页操作智能体

LangChain 官方宣布支持将 Browserbase 的浏览器代理工具集成到 Deep Agents 框架中。Browserbase 提供了一种可编程的浏览器环境,允许智能体执行点击、输入、滚动等真实用户操作,并解析动态渲染的页面内容。

通过这一集成,开发者可以构建能自动完成复杂网页任务的智能体,例如登录多因素认证网站、填写表单、抓取 JavaScript 渲染的数据,甚至进行简单的电商比价。LangChain 提供了预置的工具模板,只需几行代码即可调用。

不过,这类智能体对稳定性要求较高。网页结构变动、验证码拦截或反爬机制都可能导致任务失败。LangChain 建议在生产环境中加入重试逻辑和异常处理模块,并限制智能体的操作权限以保障安全。

Runway 推出 GPT-Image 2.5 双模式编辑

视频生成平台 Runway 上线了 GPT-Image 2.5 模型,并提供两种工作模式:Flare 和 Sunburst。

Flare 模式面向快速迭代,适合概念探索和草图生成。用户输入简短提示,模型能在几秒内输出多个风格变体,便于快速筛选方向。而 Sunburst 模式则侧重精确编辑与高保真输出,支持细粒度控制如局部重绘、光照调整、材质替换等,适合最终成品制作。

Runway 表示,GPT-Image 2.5 在物理一致性、光影真实感和细节保留方面有明显提升。例如,在生成室内场景时,模型能正确处理镜面反射和阴影投射,避免出现逻辑矛盾。两种模式共享同一底层模型,用户可根据任务阶段自由切换。

Muse Spark 1.3 Contributor 免费开放

Meta 的 Muse Spark 1.3 Contributor 模型现已通过 Cline 平台免费开放使用。官方宣称其性能接近 Anthropic 的 Opus 5,但在推理成本上更具优势。

该模型专为代码协作和文档生成优化,在 GitHub 风格的 pull request 评论、技术文档撰写等任务上表现突出。Cline 提供了与 VS Code 和 JetBrains IDE 的插件集成,开发者可直接在编辑器中调用。

需要注意的是,“Contributor”版本主要针对辅助编程场景,通用对话能力可能弱于同系列的其他变体。Meta 尚未公布完整的技术报告,但社区初步测试显示其在 Python 和 TypeScript 项目中的补全准确率较高。

行业动态补充

除上述重点外,本期还有几项值得关注的进展。Harrison Chase(LangChain 创始人)预测,具备真实计算机操作能力的智能体将在未来几个月内显著普及,核心驱动力是大模型代码生成能力的持续增强。

Fireworks AI 则指出,企业若仅依赖闭源模型或脆弱的工作流编排,将难以应对复杂业务需求。他们主张将企业自身的分类体系、风格指南和判断标准通过微调注入开放模型,构建专属智能体。

此外,苹果发布了首款折叠屏设备,起售价15999元,并称AI参与了产品设计过程。尽管对AI开发者无直接技术价值,但该设备可能成为端侧AI应用的新试验场。