DeepSeek V4.1 Flash发布,Suno v6支持图片视频转音乐,ChatGPT语音模式开放GPT-6调用

2 阅读

DeepSeek V4.1 Flash:小模型也能做多模态

DeepSeek发布了V4.1 Flash版本,这是目前该系列中参数量最小的模型,却首次原生支持多模态视觉理解。它采用552B参数的MoE(混合专家)架构,并引入Causal-Encoder-Decoder结构,在保持推理效率的同时提升了对图像内容的理解能力。

相比之前的Pro版本,Flash在KV Cache缓存设计上做了优化,大幅减少了对HBM显存和SSD存储的需求。这意味着用户在部署时能显著降低硬件成本。官方还调整了定价策略,引入峰谷计价机制——鼓励用户在非高峰时段运行任务,进一步压低使用费用。

值得注意的是,尽管体积更小,但Flash在多个视觉理解基准测试中表现优于Pro版。这说明模型性能不再单纯依赖参数规模,架构创新和工程优化同样关键。

Suno v6:让图片和视频“唱”起来

Suno平台推出了v6版本,最大的变化是支持多模态输入生成音乐。现在你可以上传一张风景照、一段短视频,甚至是一段语音备忘录,Suno会据此创作出风格匹配的歌曲。

更实用的是它的局部编辑功能。比如你对副歌部分不满意,可以直接选中那一段重新生成,而不会影响主歌或桥段。这种非破坏性编辑对音乐创作者来说非常友好。

Suno v6提供三个版本:旗舰版适合专业制作,探索版面向实验性创作,高效版则针对快速原型需求。这种分层策略让不同背景的用户都能找到合适工具。

ChatGPT语音模式升级,Pro用户可用GPT-6 Astra

OpenAI悄悄升级了ChatGPT的语音交互体验。现在Pro订阅用户在使用语音模式时,可以手动选择调用GPT-5.6 Sol或GPT-6 Astra模型。系统还会根据对话复杂度自动切换模型——简单问答用轻量模型,复杂推理则切到高性能版本。

同时,GPT-Live的使用限额规则也简化了。过去按分钟计费的方式被取消,改为更直观的日额度管理。这对经常用语音开会或做实时翻译的用户是个好消息。

不过要注意,这些高级模型目前仅限Pro套餐使用。免费用户仍只能访问基础语音功能。

亚马逊Prime Video上线AI口型同步

看外语剧时最出戏的就是配音嘴型对不上?亚马逊Prime Video最近上线了AI口型同步技术,专门解决这个问题。它通过分析原始演员的面部动作和新配音的音频波形,动态调整嘴部动画,让画面和声音真正同步。

image.png

这项技术已用于德国剧集《贵族高中:我们之间的鸿沟》的英语配音版。观众反馈显示,沉浸感明显提升。亚马逊计划将该功能扩展到更多影视作品。

image.png

不只是亚马逊,Meta和YouTube也在推类似功能。Meta的AI配音工具自带口型同步选项,YouTube则在测试自动生成多语言配音并匹配嘴型的功能。看来,跨语言观看体验正在被AI重塑。

image.png

米哈游赢下首例AI声音仿冒案

上海浦东新区法院判了一起标志性案件:某AI变声软件未经授权提供《原神》角色声音包,被认定构成不正当竞争。司法鉴定结果显示,该软件生成的试听语音与原版角色声音“倾向认定同一”。

法院最终判决被告赔偿米哈游75万元,并明确指出:使用AI模仿他人声音需获得授权。这是上海首例涉AI声音仿冒的司法判决,为后续类似纠纷提供了判例参考。

此案也提醒开发者,训练数据来源必须合法。即使技术上能复现某个声音,若未获许可,仍可能面临法律风险。

OpenAI收紧ChatGPT广告政策

OpenAI最近调整了ChatGPT平台的广告规则,明确禁止竞争对手投放图像生成和语音生成类工具的广告。这意味着像Adobe Firefly、ElevenLabs这类产品的推广链接将无法出现在ChatGPT界面中。

同时,ChatGPT的“发现”功能也不再返回外部引用链接。用户点击参考资料时,内容会被限制在OpenAI生态内展示。这一变化既保护了自家产品(如DALL·E和语音工具),也强化了平台闭环。

据内部消息,ChatGPT广告业务年化收入已突破10亿美元。收紧政策或许是为了守住这块快速增长的收入来源。

AMD推锐龙AI Max+ PRO 495迷你主机

在最近的媒体沙龙上,AMD透露将有超过20款基于锐龙AI Max+ PRO 495处理器的设备上市。有趣的是,其中绝大多数是迷你主机——只有惠普例外,它将推出基于Gorgon Halo芯片的ZBook Ultra移动工作站。

AMD显然想借PRO 495打入高性能小型PC市场。这款处理器集成强大NPU,适合本地运行AI任务。迷你主机形态既能满足桌面AI应用需求,又节省空间,对开发者和创意工作者很有吸引力。

惠普的移动工作站则瞄准专业用户,比如需要在外处理3D渲染或视频剪辑的设计师。两种形态互补,覆盖不同场景。

Kimi联手华胜天成进军企业市场

月之暗面正式启动“Kimi企业合作伙伴计划”,目标是把大模型技术嵌入企业核心业务流程。首批合作方包括华胜天成、金山云等IT服务商,它们将负责把Kimi集成到客户现有的ERP、CRM或生产系统中。

该计划不仅提供技术对接支持,还计划培养一批懂AI部署的工程师。毕竟,很多企业缺的不是模型,而是能把模型和业务打通的人。

这次合作标志着国产大模型在B端商业化迈出实质一步。过去一年,不少企业尝试AI但效果有限,往往因为缺乏落地路径。通过生态合作,Kimi或许能真正帮客户把AI转化为生产力,而不只是演示Demo。