> 新闻 > 国内新闻 > 正文

整蛊专家

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

千山暮雪

一 | 据外媒报道,1月10日,在正在进行的CES 2019上,思科首席执行官迈克尔•比斯利(Michael Bisley)表示,思科已大致开始制定6G的初步计划。    IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。比斯利表示,6G的部署还需要15至20年,毕竟5G在现阶段在世界上并不普遍。从技术发展的角度看,6G仍然是一个基本的前沿课题,需要长期努力的专门研究。他相信未来6G将能够以更紧凑、更高效的方式嵌入到任何智能设备和电子产品中,使所有东西都能真正互联。         IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。         但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。6G网络除了具有更高的网络速度、更低的延迟和更大的覆盖范围外,还将显著提高网络安全性。6G网络通过超高速检测异常行为,快速识别和处理。         谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。         GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。对于即将到来的量子计算技术的普及,比斯利说,未来6G将与量子计算技术相结合,形成一个“量子互联网”。         GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。

二 | 模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。         训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。

三 |          泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。

四 | 如果量子计算技术在市场上得到广泛应用,那么个人设备和互联网作为一个整体,对计算能力和带宽的需求可能会增加一到两个数量级。

五 |          性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。         参考。超快的网络连接速度和超快的计算效率,我们的世界的未来将是非凡的。”到那时,每个人都将成为网络的一部分,每个人都将拥有一个或多个网络接入设备,这些设备可以从娱乐、社交和工作的各个方面访问,包括超高清视频、AR、VR内容,”Bisley说。

Current article:http://nk7we4c.zanjionglangzhaizhizaxiying.buzz/list_n499pb/k5kx.html

Published on:06:32:17