OpenAI上线GPT-Live-1 API,谷歌推Gemini桌面版,DeepSeek新模型登陆WorkBuddy

1 阅读

OpenAI上线GPT-Live-1 API,语音交互更接近真人对话

OpenAI正式开放GPT-Live-1 API,这是其首个专为实时语音交互设计的模型接口。与以往先转文字再生成回复的流程不同,GPT-Live-1实现了端到端的语音理解与合成,系统延迟显著降低。

该API支持全双工对话,意味着用户可以在AI说话中途打断,模型能即时响应并调整上下文。它还能处理停顿、背景杂音等真实通话中常见的干扰。官方示例显示,该模型已能胜任餐厅预订、客服应答等任务,甚至能根据对话节奏自然插入“嗯”“好的”等语气词。

值得注意的是,GPT-Live-1并非独立大模型,而是基于现有GPT架构优化的语音专用接口。开发者需通过Audio API调用,并配合工具调用(function calling)能力实现外部操作,比如查询日历或下单。目前该API按秒计费,适用于需要低延迟语音交互的应用场景。

DeepSeek V4.1-Flash登陆WorkBuddy,旧版本同步下线

国产大模型厂商深度求索(DeepSeek)的新版本V4.1-Flash已在WorkBuddy平台上线,并提供为期两周的免费试用。这一版本最大的变化是原生支持多模态输入,用户可直接上传图片、PDF或表格,模型能结合文本指令进行分析。

相比此前的V4-Flash系列,V4.1-Flash在推理速度和上下文长度上有所提升,官方称其在代码生成和数学推理任务中表现更优。与此同时,旧版V4-Flash和实验性的V4-Flash-Vision-Exp已从平台移除,用户无法再调用。

WorkBuddy作为面向开发者的模型测试平台,此次更新后默认推荐V4.1-Flash。用户反馈显示,新模型在处理混合格式文档(如带图表的财报)时理解更准确,但对复杂图像(如手绘草图)的识别仍有局限。

谷歌Gemini桌面应用登陆Windows,支持全局快捷键

谷歌正式推出Gemini Windows桌面应用,兼容Windows 10和11系统。安装后,用户可通过全局快捷键(默认Ctrl+Alt+G)在任何界面呼出AI助手,无需切换窗口。

该应用支持多步骤任务处理。例如,用户可要求“整理上周会议纪要,生成待办事项,并邮件发送给团队”,Gemini会依次调用日历、文档和邮件功能完成操作。此外,它还能生成图片和短视频,但需联网调用云端模型,本地仅支持文本交互。

目前桌面版功能与网页版Gemini基本一致,但响应速度更快,且支持离线缓存部分历史记录。不过,高级功能如代码调试或数据分析仍需订阅Gemini Advanced。谷歌表示,未来将增加对第三方应用的深度集成,比如直接操作Excel或Photoshop。

蚂蚁集团:智能体商业进入“真实交易”阶段

蚂蚁集团CTO韩歆毅近期表示,智能体商业的“ChatGPT时刻”已经到来——不再只是演示聊天机器人,而是真正促成交易。他举例称,用户现在可以通过智能体直接预订酒店、购买保险或转账付款,整个过程由AI驱动,但交易结果真实有效。

为支撑这一转变,蚂蚁推出了AI支付体系,核心是“可信承诺引擎”。该机制确保每笔AI发起的交易都经过用户明确授权,且行为可追溯、可撤销。例如,当智能体代用户订餐时,系统会先弹出确认框,显示金额、商户和退款规则,用户点击“同意”后才执行支付。

同时,蚂蚁宣布设立1000万元发展基金,用于扶持智能体开发者。申请者需提交具体场景方案,如“AI导购”或“自动报销”,通过审核后可获得算力补贴和技术支持。首批入选项目预计在年底前上线支付宝生态。

环球音乐与ElevenLabs合作,共建正版AI音乐平台

环球音乐集团(UMG)与AI语音公司ElevenLabs达成多年期战略合作,双方将共同开发一个基于正版授权的AI音乐创作平台。这意味着未来创作者使用AI生成人声或伴奏时,所用的歌手音色和音乐素材均来自合法授权库。

合作细节显示,平台将允许词曲作者上传原创旋律,选择签约艺人的AI音色进行试唱,并生成完整demo。艺人也可主动提供自己的声音模型供授权使用,收益按协议分成。ElevenLabs负责技术实现,包括声音克隆的保真度和防滥用机制。

此举被视为AI音乐走向合规化的关键一步。过去一年,多家唱片公司起诉AI公司未经许可使用艺人声音训练模型。UMG此次选择合作而非对抗,意在将AI纳入现有版权体系。平台预计2027年初上线测试版,初期仅对签约创作者开放。

SpaceX AI团队直播:用Grok Bot三天建公司

马斯克旗下的SpaceX AI团队宣布将进行一场为期三天的直播,全程展示如何仅靠Grok Bot(xAI团队开发的智能体)从零搭建一家公司。活动涵盖产品构思、网站开发、客户获取到售后支持的完整链条。

根据预告,第一天将演示Grok Bot如何根据市场需求生成产品原型,并编写前端代码;第二天聚焦销售环节,包括自动生成pitch deck、模拟客户谈判;第三天则处理运营事务,如设置支付系统、分析用户反馈。

值得注意的是,直播中所有操作均由Grok Bot执行,人类仅提供初始指令。xAI团队称,这并非概念演示,而是真实可复现的工作流。活动结束后,相关工具链将开源,供开发者参考。

商汤“小浣熊”移动端上线,手机发指令电脑执行

商汤科技的AI办公智能体“小浣熊”正式推出iOS和安卓App。用户可在手机上通过语音下达指令,如“把昨天会议提到的三个需求整理成文档,发给张经理”,指令会同步到电脑端持续执行,即使手机锁屏也不中断。

“小浣熊”搭载商汤自研的多模态智能体引擎,能理解碎片化信息。例如,用户先在微信收到一张表格截图,随后语音说“提取Q3数据做趋势图”,智能体会自动关联前后信息完成任务。它还支持企业内网数据接入,在合规前提下融合内外部知识。

目前该App免费使用,但高级功能(如长文档分析)需订阅。商汤表示,下一步将开放API,允许企业定制专属智能体,比如对接内部CRM或ERP系统。

支付宝升级AI支付体系,推三大“AI收”能力

支付宝近期对其AI支付产品进行重大升级,核心是从“可支付”转向“可信支付”。新推出的AI钱包智能体能自动管理用户的所有AI交易,比如记录某次由智能体代订的机票,并提供一键退款入口。

同时,支付宝发布了三大“AI收”能力:Vibe Pay(基于氛围感知的支付,如根据聊天情绪推荐礼物)、Skill Pay(按技能付费,如AI家教按解题数量计费)、Machine Pay(设备间自动结算,如打印机耗材不足时自动下单付款)。

底层支撑是APASS商业信任基础设施,基于KYA(Know Your Agent)理念,为每个智能体建立身份档案,记录其意图、授权范围和历史行为。当用户与陌生智能体交易时,系统会显示其可信评分和过往纠纷记录。目前该体系已在部分商家试点,预计年底全面开放。

image.png

image.png

image.png

image.png