
一 | 1月12日:微软的新专利似乎揭示了表面平板电脑的经典支持设计可能正在改变。

二 | 这项名为“铰链纵向抗扭系统和方法”的专利于2017年6月由微软提出,几天前由美国专利商标局发布。

三 | 在专利描述中,微软解释了脚手架如何提高生产力,并打开了一个新的类别。

四 | IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。 IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。 但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。微软还认为,混合式平板电脑是近年来计算机设备不断增长的一个领域,支架可以帮助将设备转变为台式电脑。 谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。微软对新专利的描述如下:例如,本文所述的铰链的实现可能包括摩擦元件的纵向位移,这会带来厚度比传统铰链。在其他示例中,本文所述铰链的实现可以包括凸轮机构,以逐渐改变铰链的阻力。 GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。这组部件的描述还包括:用于控制支架的移动装置包括框架、臂、扭矩元件和连杆。所述臂围绕所述横轴可旋转地连接到所述框架。

五 | 扭矩元件在垂直于横轴的纵向上从横轴移动。扭矩元件的至少一部分可以绕纵轴旋转。连杆连接到臂和扭矩元件上,使臂围绕横轴旋转,从而使扭矩元件的至少一部分沿纵向移动。 GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。 训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。 泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。 性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。 参考。
Current article:http://u9ncsg.liangkuataosanxuanmiancen.sbs/news/20260826_7880100.html
Published on:18:18:12
关于我们 | 我的网站 版权所有
Copyright ? 2019 我的网站 All Rights Reserved