跳到正文

#多模态

今日 4 条
今天10月2日周五
  1. The Decoder68

    Microsoft AI 发布面向语音智能体的实时转录与语音合成模型,强调低延迟和多语言

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 和两个语音合成模型,面向语音智能体,核心是低延迟、多语言和更低价格。Microsoft 称转录模型在 Artificial Analysis 的准确率排名第一,支持 60 种语言,首个部分结果在 100 多毫秒内返回;到年底,每小时音频介绍价为 $0.54。

10月1日周四
  1. Hacker News · AI65

    Weizmann研究所发布基于fMRI的视觉重建工具,仅需1小时校准即可跨个体使用

    以色列魏茨曼科学研究所团队开发了一种能根据人脑扫描重建视觉内容的AI工具,该成果于上月在纽约认知计算神经科学会议上提出。与以往需要约40小时个人数据校准不同,新模型的“通用大脑编码器”仅需1小时fMRI数据即可在新受试者上运行,且通过结合扩散模型实现了比现有方法更精确的重建效果。 该工具的核心突破在于采用了双向训练机制:除了预测图像结构的解码器外,还引入了一个能从图像预测脑活动的编码器。这种循环训练方式使得模型能够利用大量未配对fMRI数据的公开图像进行预训练(约占70%),从而解决了高质量标注数据稀缺的问题。尽管在特定案例中存在重构错误(如将蛋糕误判为三明治堆),但整体表现显著优于此前技术。作者计划下一步将应用范围从静态图像扩展至视频、音频及梦境内容。 事实层面,该技术目前依赖高成本fMRI设备,单次扫描费用约为600至1000美元;推断层面,随着模型向EEG(脑电图)迁移,采集门槛将大幅降低,可能引发隐私泄露风险;猜测层面,若该技术被用于非自愿场景或法庭证据,将对社会伦理构成严峻挑战。