Devin Cloud 支持 SSH 远程开发,Grok 4.7 进入真实任务评测
Devin Cloud 开放终端与 SSH 远程开发能力
Cognition 为 Devin Cloud 添加了命令行接口(CLI)和 SSH 支持。现在用户可以通过 devin ssh 命令直接连接到云端开发会话,像操作本地机器一样编辑代码、启动服务、转发端口或传输文件。这项功能让开发者能更灵活地调试和部署,尤其适合需要精细控制运行环境的场景。

此前 Devin 主要以图形界面或 API 方式交互,远程操作受限。现在有了原生终端支持,用户可以运行任意命令、查看日志、管理进程,甚至集成到现有 CI/CD 流程中。官方还宣布在 10 月 8 日前免费开放 SWE-2 数据集上的试用,降低体验门槛。
这一更新标志着 Devin 正从“自动完成任务”的 AI 工具,转向支持“人机协同开发”的基础设施。开发者不再只是提交需求等待结果,而是能随时介入、干预和验证 AI 的工作过程。
Grok 4.7 进入 Agent Arena 真实任务评测
xAI 的 Grok 4.7 已正式加入 LMArena 的 Agent Arena,开始接受基于真实世界任务的长期评测。与以往仅在静态基准上打分不同,Agent Arena 模拟用户实际使用场景——比如“规划一次跨国旅行并预订机票酒店”或“分析公司财报并生成投资建议”——要求模型持续调用工具、处理反馈、修正错误,直到任务完成。
Grok 4.7 将在文本理解、视觉识别、代码生成和文档处理等多个维度与其他模型对战。目前 Arena 尚未公布具体得分,但已开放社区预测其相对 Grok 4.6 的表现。值得注意的是,Grok 4.6 刚刚登陆 Amazon Bedrock,提供 50 万上下文窗口,而 4.7 版本可能进一步优化了长程推理和工具调用能力。
Vercel 等开发平台也已接入 Grok 4.7,通过 AI Gateway 提供限时折扣。这表明 xAI 正加速将最新模型推向生产环境,而不仅停留在研究或演示阶段。
ElevenLabs Studio 4.0 整合视频创作全流程
ElevenLabs 推出 Studio 4.0,将视频、图像、语音、音乐和音效生成整合到同一项目中。用户可以在一个界面里完成从脚本生成、角色配音、背景配乐到画面合成的全部步骤,并支持添加字幕、剪辑片段和导出成品。
新版本还加入了团队协作功能:成员可直接在时间轴上对特定视频片段或素材添加评论,系统会自动整理反馈便于后续修改。这对广告、教育或社交媒体内容团队尤其有用,避免了在多个工具间来回切换和沟通错位。
过去,AI 视频工具往往只解决单一环节(如文本转语音或图像生成),而 Studio 4.0 试图打通端到端流程。虽然最终效果仍依赖各模块的协同质量,但一体化设计确实降低了非专业用户的创作门槛。
LlamaIndex Extract 引入字段级置信度评分
LlamaIndex 为其结构化数据提取工具 Extract 新增了“Grounded Confidence”功能。当从文档中抽取信息(如发票金额、合同条款或简历技能)时,系统会为每个字段生成一个可信度分数。高置信度的结果可自动进入下游流程,低置信度的则标记出来交由人工复核。
这一机制解决了企业应用中的关键痛点:完全依赖 AI 可能引入错误,但全人工审核又成本过高。通过置信度过滤,既能提升自动化率,又能控制风险。例如,在处理上千份供应商发票时,系统可自动录入 80% 高置信字段,仅将剩余 20% 存疑项交给财务人员确认。
该功能基于模型对原始文本证据的追溯能力——如果提取结果有明确上下文支撑,置信度就高;若依赖模糊推断,则分数较低。这比简单返回“是/否”更实用,也更符合实际业务逻辑。
Gemini 编程辅导工具支持屏幕理解与语音讲解
Google 展示了一款基于 Gemini Live 的编程辅导工具。它不仅能听懂用户的问题,还能“看到”屏幕上的代码,通过语音实时指出错误位置、解释逻辑漏洞,并调用 p5.js 等库进行交互式演示。
例如,当用户写了一个动画程序但画面不动,工具会说:“你忘了在 draw 函数里更新坐标,看这里……”同时高亮相关代码行。如果涉及图形概念,它还能当场生成一个简化版示例帮助理解。这种“边看边讲”的方式比纯文本问答更直观,尤其适合初学者。
该工具依赖 Gemini 3.8 Live Extended Thinking 模型,具备长时间上下文理解和多模态推理能力。目前主要用于教育场景,但未来可能集成到 Google Cloud 的开发者工具链中,成为实时编程助手。
Google Cloud 优化跨区域 AI 推理与冷启动
Google Cloud 发布两项 GKE(Google Kubernetes Engine)更新,旨在提升 AI 推理效率。首先是多集群 GKE Inference Gateway,可在全球不同区域间智能路由请求,将跨区流量开销控制在 1% 以下,确保用户就近访问低延迟服务。
其次是 Pod snapshots 功能,用于减少冷启动时间。当新 Pod 启动时,无需重新加载整个大模型文件,而是从预存快照恢复状态。这对于频繁扩缩容的 AI 服务尤为重要——比如夜间批量处理任务结束后缩容,白天高峰前快速扩容,快照能让新实例秒级就绪。
这两项改进直击 AI 应用落地的两大瓶颈:延迟和成本。跨区路由避免了“南美洲用户连亚洲服务器”的尴尬,而快照机制则降低了 GPU/TPU 的空转浪费。Benchling 等客户已用类似方案实现多租户 AI 代理的安全隔离与高效执行。
curl_cffi 解决 VPS 抓取被拦截问题
有开发者分享,使用 VPS 抓取网页时常被 Cloudflare 等反爬系统拦截,即使换用高级模型(如 GPT-5.6 或 GLM-5.3 Flash)也难以绕过。后来改用 curl_cffi 库模拟 Chrome 浏览器的 TLS 指纹,成功伪装成真实用户请求,解决了访问限制。
curl_cffi 是 curl 的 Python 封装,底层调用 BoringSSL,能精确复现浏览器的加密握手特征。相比 Selenium 等重型方案,它轻量且隐蔽,适合嵌入 RSS 阅读器、监控脚本等后台服务。该实践者还借此为自己的 RSS 工具增加了“视频总结”功能——先抓取页面,再调用 AI 提取核心内容。
这类技巧虽小众,却反映了当前网络环境的现实:AI 应用不仅要处理数据,还得应对复杂的前端防护。掌握底层协议细节,有时比升级模型更有效。
两万条反馈揭示编码代理主要槽点
LMArena 分析了来自 29 个模型的 20840 条用户反馈,发现对编码代理的投诉高度集中:69.1% 的问题在于生成的代码根本无法运行(如语法错误、缺失依赖或逻辑死循环);27.1% 是输出不完整(只写一半函数或忽略边界条件);另有 27.1% 指可用性差(如不遵循项目规范、命名混乱或缺乏注释)。
有趣的是,“代码失效”占比远超其他问题,说明当前模型在基础正确性上仍有硬伤。用户并不苛求完美架构,但至少希望代码能跑起来。相比之下,表扬多集中在“快速生成样板代码”或“解释复杂错误”,说明辅助价值已被认可,但可靠性仍是最大短板。
这些数据也解释了为何 Devin Cloud 要开放 SSH——让用户能立即修复 AI 的错误,而不是被动接受一个坏结果。未来的编码代理或许不是“全自动”,而是“半自动+即时修正”的混合模式。