谷歌Gemini虚拟人上线,97种语言实时唇形同步太炸了
谷歌在上周推出Gemini 3.8 Live的基础上,正式发布了Live Avatar功能——给实时对话模型加上了一张"脸"。核心技术是接近实时的视频生成+语音+唇形同步三合一,支持97种语言无缝切换且不降画质。企业客户还可以通过高质量参考图自定义虚拟形象,所…
1. 谷歌Gemini 3.8 Live Avatar正式上线:97种语言无缝切换的实时虚拟人
谷歌在上周推出Gemini 3.8 Live的基础上,正式发布了Live Avatar功能——给实时对话模型加上了一张"脸"。核心技术是接近实时的视频生成+语音+唇形同步三合一,支持97种语言无缝切换且不降画质。企业客户还可以通过高质量参考图自定义虚拟形象,所有生成内容内置SynthID隐形水印。目前已在Gemini Enterprise全面开放。
2. DeepSeek Harness桌面版发布:不用命令行,小白也能本地跑大模型
深度求索正式上线DeepSeek Harness官方桌面版(v0.1.7-rc.2),支持Windows x64和macOS Apple Silicon。最大亮点是零门槛——不需要Node.js、不需要终端、不用手动输命令。提供标准、PTC、极简和创造四种运行模式,支持插件化扩展与Agent定制。底层基于MIT开源的Cordis插件系统,TypeScript开发,"一切皆插件"的设计理念。
3. vLLM上线Gumbel-max无损文本水印:推理损耗不到2%
主流开源推理框架vLLM正式集成Gumbel-max无损文本水印机制。技术方案通过微调模型生成采样逻辑,在不改变文本输出质量、不偏移概率分布的前提下植入可检测的溯源水印。实测推理损耗低于2%,兼容推测解码、批量推理等企业级场景,填补了开源大模型在内容溯源方面的技术空白。
4. Black Forest Labs开源FLUX 3 Action:70亿参数杀入具身智能
图像生成大厂Black Forest Labs正式入局机器人赛道,开源FLUX 3 Action具身动作模型。70亿参数的轻量模型可以直接基于实时摄像头视频流预判机器人行动轨迹,在RoboLab-120基准测试中刷新行业纪录,推理速度较前代顶尖模型最高提升3.95倍。
5. 科大讯飞发布Spark-ASR-2.0:202种方言免切换,全国产算力训练
科大讯飞发布新一代语音识别大模型Spark-ASR-2.0,基于自研Spark-Audio-1.0-Preview语音基座升级。核心突破有三个:上下文语义纠错、多场景降噪、202种方言免切换识别。能自动剔除口语赘余、修正同音字歧义、规整数字格式。在嘈杂环境、低声耳语、中英混合、专业术语等场景下识别精度大幅提升,推理成本仅较上代增加10%。全流程依托全国产算力训练。
6. GitHub开源Taskflow Agent:用AI自动给开源项目做模糊测试
GitHub安全实验室公开了Taskflow Agent自动化模糊测试工作流,利用LLM智能体实现代码安全测试全流程自动化。它能自主识别代码测试盲区、补写测试套件、统计覆盖率、筛选崩溃漏洞、分流排查问题。目前适配所有C/C++项目。
7. Liquid AI开源VL-DSpark:多模态推测解码降低推理延迟
Liquid AI推出LFM2.5-VL-DSpark多模态推测解码架构,打通图像Patch与文本Token的统一隐空间映射,通过单层注意力网络批量生成候选Token。不需要改动原有视觉推理逻辑,就能显著压缩端到端生成延迟,为端侧和轻量化多模态模型提供新的加速方案。
8. Meta个人智能体Muse被曝安全漏洞:可直接导出底层Linux系统文件
两名安全开发者独立发现,Meta推出的个人AI智能体Muse存在提示注入防护薄弱问题。通过简单的提示词就能诱导其打包并导出云端虚拟机中的大量Linux核心文件,包括113份子智能体追踪记录、近20份内部功能文档以及68个技能连接器配置,可能暴露后端架构细节。
📮 今日互动
今天的8条动态里,你最关注哪一条?或者你最近在开发中遇到了什么AI相关的技术问题?评论区聊聊,小猴下期帮你找答案。
觉得有用的话,转发给你的技术群里,让更多人看到 👆
内容由公众号日报整理而来,代表原文作者观点,不构成任何投资建议。 信息以公开发布时的报道为准,时效性内容请以最新消息为参考。