跳到正文

#多模态

今日 17 条
今天10月2日周五
  1. Hacker News · AI68

    olddogs.ai 团队用四个 agent 工作流建成零 slop 官网并把渲染提速到 117 fps

    olddogs.ai 团队用四个 agent 工作流建成自家官网首页,页面全部内容出自对 agent 的 prompt,作者称成品独特且零 slop,其中一次要求提速的 prompt 让 agent 把 Canvas 渲染改写为 GPU shader,快速鼠标拖拽时帧率从 14 fps 升到 117 fps。四个工作流分别是先用生成图像模型探索设计再落代码、嵌入应用的 in-app design jig、独立小应用 jig、以及直接向 agent 提最夸张的要求。 容易被忽略的是探索与实现的分离尺度,首页八个 section 各自生成 8 到 38 个设计选项并经历 1 到 7 轮设计与构建循环,全项目累计 2,460 张生成图像,作者还公开了按顺序排列的全部图像。in-app design jig 是只给开发者用的参数面板,改动可以同步回提交代码,standalone jig 则服务于 50 多对狗图像的逐张审查,反馈一键复制回 Codex。shader 内做的分部件动画只给页面增加约 77 KB,说明夸张要求在体积代价上并非失控,而 117 fps 的口径是 1440×900 分辨率与 120 Hz 显示器下的测试值。 事实部分仅为作者自述的工作流与数字,未经第三方复核。推断是图像先行的做法之所以能避开同质化,是因为把设计探索放在图像空间而非代码空间,绕开了 agent 第一个设计方案的路径依赖,jig 则把人的审美判断变成可反复操作的界面而不是一次性 prompt。猜测是这套模式可迁移到其他 agent 前端项目,但作者未披露 2,460 张图像的生成成本与人工筛选耗时,单位经济不明,照搬前需要自行补测。

  2. Hacker News · AI42

    macOS 开源本地 AI 语音克隆工具 DVG 发布

    开源工具 DVG 在 macOS Apple Silicon 设备上提供本地运行的 AI 语音克隆与对话生成功能。该工具基于 Seed-VC LLM 实现语音转语音,利用 Chatterbox LLM 完成文本转语音,支持多角色情感配音及对话混音导出。用户仅需约 16GB 存储空间即可通过短音频片段克隆角色声音并生成自然对话。

  3. InfoQ 中文42

    火山引擎发布语音内容编辑模型:像改文字一样修改口播

    火山引擎推出全新语音内容编辑模型,支持用户通过自然语言指令直接修改已录制视频中的特定词汇。该模型基于自研底座,能将原音频转换为离散 Token 并结合指令进行语义规划,在替换“败血症”为“坏血病”等场景时保持原音色与韵律。此技术旨在降低重录成本,实现从“修音质”到“改内容”的语音编辑升级。

  4. The Decoder68

    Microsoft AI 发布面向语音智能体的实时转录与语音合成模型,强调低延迟和多语言

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 和两个语音合成模型,面向语音智能体,核心是低延迟、多语言和更低价格。Microsoft 称转录模型在 Artificial Analysis 的准确率排名第一,支持 60 种语言,首个部分结果在 100 多毫秒内返回;到年底,每小时音频介绍价为 $0.54。

  5. Hacker News · AI18

    Prelulu:面向消费者的 Tavus Griffin 实时 AI 视频通话替代方案

    Prelulu 作为面向消费者的应用,提供与虚构角色的文本、语音及支持的视频实时通话功能。相比 Tavus Griffin 仅限早期测试人员的受限研究预览,Prelulu 允许用户直接体验角色互动并查看明确的计费计划。该服务专注于浪漫关系与记忆连续性,而非为开发者构建通用视频智能体 API。

  6. Hacker News · AI78

    ImageGen 在 Mac 本地运行 Qwen-Image 2.1 生成图像,并用内置 MCP server 接入 Claude Code 等 Agent

    ImageGen 把 Qwen-Image 2.1 搬上 Apple Silicon Mac 本地运行,并以内置 MCP server 让 Claude Code 等 Agent 直接生成和编辑图像。这款 MIT 许可的开源 macOS 原生应用从 Hugging Face 一键下载约 33 GB 的模型权重,用 Metal 在 Mac GPU 上推理,下载完成后完全离线,不需要 API key,也没有单张图像费用;作者建议 64 GB 统一内存机型,48 GB 只能加载模型并跑小尺寸图。 README 给出的实测数据来自一台 64 GB 统一内存的 M5 Pro MacBook Pro,bf16 精度下 512x512 草稿 20 步约 20 s,1024x1024 30 到 40 步约 1.5 到 2 min,2048x1152 40 步约 5.5 min,模型加载约 20 s。比速度更容易被忽略的是两道边界:内存防护把 PyTorch 可用内存限制在总内存减 30%(至少留 12 GB),超大尺寸在开始前就被拒绝,macOS 报告临界内存压力时任务中止,避免 swap 卡死整机;许可方面 ImageGen 代码是 MIT,但 Qwen-Image 2.1 适用 Qwen Research License Agreement,仅允许非商业的研究与评估用途,商用需另行向 Qwen 取得授权,应用不捆绑权重,用户下载时自行接受该许可。 事实层面,端侧文生图已经跨过 64 GB 统一内存 Mac 可承载约 33 GB 权重的 state-of-the-art 图像模型这条线,并通过 MCP 把本地图像能力挂进 Agent 工作流,generate_image 与 edit_image 等工具返回 PNG 路径和预览供 Agent 自查。推断是这类工具会先吸收对隐私、离线和单张成本敏感的个人开发者需求,替代一部分云图像 API 调用;猜测是若 catalog 后续加入更小模型,覆盖 32 GB 机型后渗透面会明显扩大。对准备把图像生成嵌进产品的团队,许可结构是先于性能要核对的一项:非商业许可意味着客户交付场景必须先解决模型授权。

    推荐理由:仓库给出 Qwen-Image 2.1 在 64 GB Mac 上本地生成的内存与耗时数据,并内置 MCP server 供 Claude Code 调用;模型许可仅限非商业,直接约束能否进入客户项目。

  7. arXiv cs.CR78

    黑盒多模态 RAG 数据提取攻击在 2500 次查询中最多重建 611 张放射科图像

    针对图像返回型多模态 RAG 的黑盒自适应数据提取攻击把恶意指令嵌入用户输入图像,而不是把恶意查询放在文本 prompt 中。实验覆盖医疗助手、文档助手和通用工具三个场景,在多个 CLIP-family retrievers 与不同 generators 下,单次 2500-query run 在 local-feature correspondence 下最多重建 611 张放射科图像、566 份文档扫描和 416 张通用图像,并达到非自适应 baseline 最多 5.6 倍。事实是攻击可沿 embedding space 中仍能产生新检索的区域自适应推进;推断是 MRAG 的图像检索与返回通道本身构成数据源泄露入口,防护需要覆盖多模态输入、检索和图像输出,而不只是文本 prompt。

    推荐理由:它把多模态 RAG 的数据提取风险从文本提示扩展到图像输入,并给出黑盒自适应攻击的量化结果,能直接校正对 MRAG 安全边界的判断。

  8. arXiv cs.CR68

    ReCast 用合同保持的改写框架保护固定接口多模态推理中的源内容

    ReCast 是一个 agentic plug-in 框架,用于在调用远程多模态模型时保护私有输入。它不是简单做文本脱敏或身份匿名化,而是保留任务相关关系和所需输入模态,替换源特定内容,从而在图表、语音等固定媒体接口下降低敏感内容暴露。 具体机制上,ReCast 先在本地把输入转换成共享的文本 evidence-query record,再用一个蒸馏出的 4B 模型联合改写实体和主题,并通过本地可逆、角色感知的数值映射替换数值。随后由重建 agent 从受保护记录生成并验证所需媒体。远程 solver 返回程序后,受保护操作数会在本地执行前恢复。论文在 4,000 个 ChartQA 和 NMSQA 留出样本上报告了结果:ReCast 达到 75.10% 准确率,保留了未保护远程准确率的 92.43%;基于模型的审计标记出 7.95% 的 solver-bound 请求存在源内容泄漏。 这篇工作的关键增量在于,它把隐私保护问题从“隐藏身份”重新定义为“保持任务合同但替换源内容”。事实是论文给出了准确率、保留率和泄漏率三项指标;推断是这种方法更适合必须向远程多模态服务提交图表或语音、但又不能直接暴露原始内容的场景;猜测是其实际部署价值取决于审计模型对泄漏的识别能力是否足够可靠。

    推荐理由:它把隐私保护从“匿名化”推进到“合同保持的可重写接口”,可改变多模态外包推理的安全设计判断。

  9. arXiv cs.CR72

    UnifiedAttack 评测大尺寸多模态模型在协同有害图文生成中的安全漏洞

    UnifiedAttack 是一个针对原生统一多模态模型的安全评测基准,重点不是单模态有害内容,而是文本与图像协同后产生的额外危害增益。论文同时提出一个协同劫持框架,用 In-Context Reskinning 和 Cognitive Planning Injection 验证漏洞:前者通过 few-shot 方式把对抗意图包装进看似良性的虚拟外壳,降低安全过滤敏感度;后者强制模型先进入中性逻辑规划,再利用其保持一致性的倾向诱导后续生成有害多模态内容。 论文称在多种先进架构上,UnifiedAttack 能持续绕过现代对齐机制。这个结果的关键含义是,统一模型的结构性有用性和逻辑连贯性可能被系统性武器化,因此仅靠单模态内容过滤或通用拒答策略不够,安全防御需要进入协同生成任务的逻辑规划层。 事实是论文提出了基准、攻击方法和实验结论;推断是这类攻击对统一多模态产品尤其相关,因为图文同模型生成会减少跨模块审查点;猜测是未来安全评测会增加 logic-aware defenses 和跨模态协同风险指标。

  10. arXiv cs.AI68

    MemFit 提出无 LLM 写入与检索的长期智能体记忆系统

    MemFit 提出一种无 LLM 写入与检索的长期智能体记忆系统,并在三个基准上报告 SOTA 与数倍构建时间与成本下降。 现有长期记忆系统常依赖 LLM 智能体组织和整合记忆,导致写操作昂贵且低效;MemFit 改为把每轮对话原文近即时追加到 append-only store,用 segment summaries 索引,而不是通过压缩丢弃表面细节或替换原始轮次。 检索侧使用无 LLM 的多路径检索策略,结合词汇与语义信号和 cross-encoder reranking,对 caption-augmented episodes 做重排,覆盖文本与多模态设置。 事实是论文报告了上述机制和 LoCoMo、MemGallery、LongMemEval-S 上的 SOTA 与数倍构建时间、成本下降,并称其提供可扩展、高效的 persistent agentic memory;推断是它可能降低高频对话中的调用成本;猜测是真实长周期 Agent 场景效果仍需完整论文验证。

    推荐理由:它把长期记忆写入从大模型调用改为无大模型调用的追加索引,能校正对智能体记忆成本、延迟、可扩展性与可用性的判断。