Kimi上线手机远程控制,GPT-6算力告急,285B视觉模型跑在消费级GPU
Kimi Work 支持手机远程控制电脑任务
Kimi 最近上线了新功能:用户现在可以用手机远程控制正在电脑上运行的 Kimi Work。这意味着你可以在离开办公室后,通过手机继续推进那些需要长时间运行的任务,比如批量处理文件、自动填写表格或者执行复杂的自动化流程。

这项功能的核心是让 AI Agent 在电脑端持续运行,而用户通过移动端下达指令或查看进度。实际体验中,任务状态同步比较及时,操作延迟在可接受范围内。对于经常需要在不同设备间切换的用户来说,这确实省去了反复登录和重新配置的麻烦。
不过目前该功能仍处于早期阶段,仅支持部分任务类型,且对网络稳定性有一定要求。如果手机信号不好,可能会出现指令丢失或响应迟缓的情况。官方表示后续会优化连接机制,并扩展支持的任务范围。
阿里云详解架构师Agent如何落地企业
阿里云最近分享了一套关于“架构师Agent”在企业内部落地的实践经验。这个Agent的目标不是写代码,而是帮助技术团队理解复杂的业务系统,并辅助做出架构决策。
具体来说,它能跨多个系统读取文档、接口定义和部署拓扑,然后回答类似“如果我们要把订单服务迁移到新数据库,会影响哪些下游模块?”这样的问题。在实际项目中,团队发现它能显著缩短新成员熟悉系统的时间,也能在方案评审阶段提前发现潜在的耦合风险。
但挑战也很明显。最大的难点在于如何让Agent准确理解企业内部特有的术语和流程。阿里云的做法是结合知识图谱和微调,把历史架构文档、会议纪要和变更记录都纳入训练数据。他们强调,这类Agent的成功关键不在于模型本身多强大,而在于能否与现有工程体系深度集成。
GPT-6 Astra 遭遇算力瓶颈
最近不少 OpenAI Pro 用户反映,在使用 GPT-6 Astra 时频繁遇到“当前算力不足,请稍后再试”的提示。据社区消息,OpenAI 内部人士承认 Astra 的推理需求远超预期,公司正在紧急调配更多 GPU 资源。
有传言称,如果需求继续增长,OpenAI 可能会暂时停止新增 Pro 订阅,以优先保障现有用户的体验。这一情况也解释了为什么官方迟迟没有全面开放 Astra 的高推理等级选项——高配置意味着更高的算力消耗,而当前资源已经捉襟见肘。
与此同时,一篇分析文章详细对比了 Astra 不同推理等级下的 Token 消耗。结果显示,开启“深度思考”模式后,处理相同任务的 Token 用量可能增加 3 到 5 倍。作者建议普通用户优先使用默认配置,仅在处理复杂逻辑或长文档时才临时切换到高阶模式,以控制成本。
GPT-image-2.5 无法生成透明 PNG
社区用户实测发现,GPT-image-2.5 近期在生成带透明背景的 PNG 图像时表现异常。无论怎么调整提示词,输出的图片总是带有白色或黑色底色,无法保留 Alpha 通道。
有人推测这可能与模型最近的更新有关。为了提升生成速度或兼容性,开发团队或许移除了对透明通道的支持,或者训练数据中缺乏足够的透明 PNG 样本。目前尚无官方回应,但用户建议如需透明背景,可先用其他工具生成,再通过图像编辑软件手动抠图。
这个问题虽然看似小众,但对设计师、前端开发者等依赖透明素材的群体影响较大。如果属实,说明多模态模型在细节处理上仍有明显短板,离“开箱即用”还有距离。
285B 视觉 MoE 模型跑在消费级 GPU 集群
一个令人意外的进展是,社区成功在 10 到 12 张 RTX 3090 显卡上运行了 DeepSeek-V4-Flash-Vision-Exp 模型。这是一个拥有 2850 亿参数的视觉混合专家(MoE)模型,通常被认为只能在高端数据中心部署。
测试者使用了量化和投机解码等优化技术,最终实现了每秒 2 到 3 张图像的推理速度。虽然远不及云端服务,但对于本地研究或小规模应用来说已经足够。更重要的是,这证明了消费级硬件在合理配置下也能承载超大规模模型,为个人开发者和小型团队提供了新的可能性。
不过需要注意,这套方案对内存和显存管理要求极高,普通用户很难直接复现。测试者也提醒,RTX 3090 的功耗和散热在长时间运行下是个挑战,建议搭配专用机箱和电源。
长对话压缩的新思路:递归摘要与分层记忆
随着 Agent 应用越来越复杂,上下文长度成为瓶颈。Reddit 上有开发者提出了一种结合“递归摘要”和“分层记忆”的对话压缩方案。
基本思路是:将长对话按时间或主题切分成多个片段,对每个片段生成简短摘要;再对这些摘要进行二次摘要,形成层级结构。在实际推理时,只加载最相关的原始片段和高层摘要,从而大幅减少 Token 占用。
例如,一个持续一周的客服对话可以分为“问题描述”“排查过程”“解决方案”三段,每段摘要 50 字,总开销不到 200 Token,远低于保留全部原文。当然,这种方法会损失部分细节,适合对精确性要求不极端高的场景。
目前已有开源项目尝试实现这一机制,但效果仍需更多实测验证。不过方向值得肯定——与其一味追求更长上下文,不如聪明地压缩和组织已有信息。
星火 X2.5 实测表现
国产模型星火 X2.5 最近接受了多场景实测。在图像生成方面,它能根据“粒子月亮”这类抽象描述产出风格化作品;处理 61 页的财报 PDF 时,能准确提取关键财务指标并做趋势分析;在代码调试中,还能定位到某段 Python 脚本中因变量未初始化导致的运行错误。
整体来看,它在中文长文档理解和基础编程任务上表现稳定,但在复杂逻辑推理或多轮交互中仍有提升空间。值得注意的是,所有测试均在公开 API 上完成,未使用任何私有增强手段,说明其基础能力已具备实用价值。
对于关注国产替代的团队来说,星火 X2.5 提供了一个不错的选项,尤其在处理中文商业文档时,其准确率甚至优于部分国际模型。