Microsoft AI 发布面向语音智能体的实时转录与语音合成模型,强调低延迟和多语言
Microsoft AI 发布 MAI-Transcribe-2-Streaming 和两个语音合成模型,面向语音智能体,核心是低延迟、多语言和更低价格。Microsoft 称转录模型在 Artificial Analysis 的准确率排名第一,支持 60 种语言,首个部分结果在 100 多毫秒内返回;到年底,每小时音频介绍价为 $0.54。
Microsoft AI 发布 MAI-Transcribe-2-Streaming 和两个语音合成模型,面向语音智能体,核心是低延迟、多语言和更低价格。Microsoft 称转录模型在 Artificial Analysis 的准确率排名第一,支持 60 种语言,首个部分结果在 100 多毫秒内返回;到年底,每小时音频介绍价为 $0.54。
东京法院在AI克隆案中对人类声音给予法律保护。材料仅包含标题,未提供案件细节、判决理由或适用法条。因此只能确认该事件涉及AI声音克隆与人类声音权益,不能据此推断具体赔偿、禁令或行业影响。
Black Forest Labs 发布 Flux 3 Image,官方称其支持多步编辑且不改变图像其余部分。该模型是 Flux 3 模型族的图像侧,覆盖文生图、图生图、文字渲染和写实生成。
Tavus 推出 Griffin,并将其称为首个 Human Interaction Model(HIM),目标是理解并维持实时面对面视频对话。Griffin 在通话中同时处理语音、表情、语气、手势和停顿,并生成视频回应。
以色列魏茨曼科学研究所团队开发了一种能根据人脑扫描重建视觉内容的AI工具,该成果于上月在纽约认知计算神经科学会议上提出。与以往需要约40小时个人数据校准不同,新模型的“通用大脑编码器”仅需1小时fMRI数据即可在新受试者上运行,且通过结合扩散模型实现了比现有方法更精确的重建效果。 该工具的核心突破在于采用了双向训练机制:除了预测图像结构的解码器外,还引入了一个能从图像预测脑活动的编码器。这种循环训练方式使得模型能够利用大量未配对fMRI数据的公开图像进行预训练(约占70%),从而解决了高质量标注数据稀缺的问题。尽管在特定案例中存在重构错误(如将蛋糕误判为三明治堆),但整体表现显著优于此前技术。作者计划下一步将应用范围从静态图像扩展至视频、音频及梦境内容。 事实层面,该技术目前依赖高成本fMRI设备,单次扫描费用约为600至1000美元;推断层面,随着模型向EEG(脑电图)迁移,采集门槛将大幅降低,可能引发隐私泄露风险;猜测层面,若该技术被用于非自愿场景或法庭证据,将对社会伦理构成严峻挑战。