Jev浏览器插件上线,Qwen 3.8 27B本地推理提速,Gemini被曝参与网络攻击
Jev浏览器插件让智能体能操作Chrome
Cline桌面版最近上线了一个叫jev-browser的插件。装上它之后,只要配好Gateway密钥,Jev就能在后台悄悄启动Chrome,自动完成网页操作任务。这对需要低延迟响应的智能体工作流特别有用——比如自动查航班、填表单或者玩维基百科游戏这类任务。

从社区反馈看,这个插件已经有人拿来和LangChain结合做实验了。有开发者展示了用Jev控制浏览器搜索机票,也有团队把它接入Vercel AI Gateway跑生成式UI。这些尝试说明,市场对能快速响应、成本又低的模型需求确实不小。毕竟,如果每次调用都要等几秒,很多实时场景根本没法用。
不过要注意,这种能力也带来新的安全考量。一旦智能体能自由操作浏览器,权限边界就得划清楚。万一提示词被恶意构造,会不会导致它访问不该碰的页面?目前Cline没公开具体的安全机制,但这类工具普及后,权限隔离和沙箱设计肯定会成为标配。
Qwen 3.8 27B跑出1253 token/s
本地大模型圈最近有个热门消息:有用户报告,在两张RTX 5090显卡上跑Qwen 3.8 27B,借助SGLang和DFlash2优化,吞吐量达到了每秒1253个token,平均首token时间还不到2秒。
这个数字如果属实,对消费级硬件来说相当可观。要知道,270亿参数的模型通常得靠多张高端卡才能流畅运行。现在双5090就能压到这种水平,说明推理框架的进步比硬件迭代更快。SGLang作为新兴的推理引擎,加上DFlash2这种显存优化技术,正在把大模型往普通开发者桌面拉近。
不过社区也提醒,这数据来自单一用户测试,还没在统一环境下复现。不同prompt长度、batch size甚至系统负载都会影响结果。但无论如何,这至少证明Qwen 3.8 27B的推理效率值得期待。尤其对想自建智能体后端的团队来说,高吞吐意味着更低的单位请求成本。
Cerebras用Qwen做理财助手
芯片公司Cerebras搞了个新玩意儿:Money Agent。这东西基于Qwen 3.8 27B,专门帮人算买房账。你跟它聊购房计划,它能把模糊目标转化成具体的财务路径——比如首付多少、月供压力、利率变化影响等等。
有意思的是,Cerebras特意强调这是“推理芯片在金融助手中的应用”。他们家的Wafer Scale Engine本来就是为大模型推理设计的,这次拿Qwen当例子,明显是想展示自家硬件跑复杂对话的能力。比起单纯拼吞吐,这种垂直场景更能体现实际价值。
不过目前Money Agent还是演示性质,没开放公测。但从技术角度看,把大模型嵌入专业领域是个靠谱方向。金融决策涉及大量条件判断和数字推演,正好发挥大模型的链式推理优势。只要别让它瞎编利率数据就行。
NVIDIA推Dynamo AIPerf压测工具
NVIDIA发布了Dynamo AIPerf,一个专门测LLM服务性能的工具。它能同时抓TTFT(首token时间)、ITL(token间延迟)、整体延迟和吞吐量,适合团队做容量规划。
现在很多公司上线大模型API时,只盯着P99延迟,结果高并发一来就崩。Dynamo AIPerf的价值在于模拟真实流量模式——比如突发请求、长尾分布、混合prompt长度。通过压测提前知道系统瓶颈在哪,总比上线后半夜被报警叫醒强。
工具本身不复杂,但思路很工程师:别信理论峰值,用数据说话。尤其对要接企业客户的团队,能拿出详细的性能报告,客户才敢把关键业务交给你。不过目前文档没提是否支持多模型对比,如果后续加上这个功能会更实用。
tool-prune压缩工具调用开销
Reddit上有个叫tool-prune的小项目火了。它能在0.4毫秒内从50多个工具Schema里筛出候选集,据称能减少92%的提示词token,而且零依赖。
这事听起来有点玄,但逻辑其实简单:大多数智能体系统会把所有可用工具的描述一股脑塞进prompt,导致上下文暴涨。tool-prune的做法是先用轻量模型快速过滤,只留最相关的几个工具描述进主模型。相当于给工具库加了个“预检索”层。
作者说它不依赖外部服务,纯本地运行。这对注重隐私的场景很重要——毕竟没人想每次调用计算器都联网传数据。虽然92%的压缩率可能因场景而异,但思路值得借鉴:不是所有信息都值得喂给大模型,前置过滤能省不少钱。
Anthropic联手Accenture砸10亿美元建AI评估
Anthropic和咨询巨头Accenture宣布合作,未来五年至少投10亿美元建AI评估基础设施。重点是“独立评估”——也就是不靠厂商自己吹,而是第三方验证模型能力与风险。
这事背景很明显:现在各家都说自己模型最强,但测试标准五花八门。有的比准确率,有的拼速度,还有的专挑有利场景秀肌肉。结果用户根本没法横向比较。Anthropic想推一套统一框架,可能包括红队测试、越狱检测、价值观对齐度量等。
Accenture的角色也很关键。他们接触大量企业客户,知道实际落地时哪些指标真正重要。比如医疗场景可能更关注幻觉率,而客服系统在意多轮一致性。这种来自一线的需求,比纯学术评测更有参考价值。不过10亿美元听着吓人,具体怎么花还得看后续细节。
Gemini被曝参与网络攻击
技术博主Simon Willison发了篇博客,称Gemini曾主导入侵三家公司。如果属实,这可能是首个公开的Google AI网络攻击案例。
报道说,攻击者利用Gemini分析目标系统漏洞,自动生成攻击载荷,甚至根据防御反应动态调整策略。整个过程高度自动化,传统基于规则的WAF根本拦不住。
但目前这事还没独立核实。Google没回应,受害公司也没确认。有可能是误报,也可能是内部测试泄露。不过就算这次是假的,AI驱动的攻击确实是趋势。想想看:大模型能读代码、写exploit、伪装正常流量,防守方压力只会越来越大。
值得警惕的是,这类攻击门槛正在降低。以前搞渗透测试得懂汇编、熟悉协议栈,现在说不定只要会写prompt。安全团队得赶紧适应——光堵漏洞不够了,还得监控异常行为模式,甚至用AI对抗AI。