monty
免费试用 Monty
全部文章
指南2026-07-16· 8 分钟阅读

横屏转竖屏:智能人脸追踪裁剪,而非死板的居中裁剪

把16:9转成适配Reels、Shorts和TikTok的9:16,还不砍掉人头。智能人脸追踪裁剪如何运作、真实数据以及安全区。


你手上有一段横屏素材:一次采访、一场网络研讨会、一段播客、或是用相机拍的东西。而平台想要的是竖屏。Reels、Shorts和TikTok在手机上全屏播放,这个比例就是9:16。最快的转换方法是居中裁剪,最快毁掉它的方法同样是居中裁剪。

咱们来拆解一下:为什么死板的居中裁剪偏偏切掉了最重要的部分,智能人脸追踪裁剪到底怎么运作,以及支撑「竖屏在手机上真的更抓眼球」这一说法的数据是什么。

为什么居中裁剪是个坏主意

当你从一帧16:9里切出一条9:16的竖带时,你就实实在在地扔掉了两侧。原始画面宽度只剩下大约56%,其余的都出了画面(Transcriptr)。如果你把裁剪框钉在正中央、一动不动,任何偏离中心站着的人都会丢掉半张脸。讲话的人走向白板就消失了。两个人对话,画面里只剩他们之间的一堵空墙。

居中裁剪对内容一无所知。它只是切出矩形的几何正中,而视频里重要的部分几乎从不老老实实待在正当中。

死板的居中裁剪

  • 裁剪框钉死在画面中央
  • 偏在一侧的讲话人被切成两半
  • 人一动,画面纹丝不动
  • 两人对话变成一堵空墙
  • 快是快,但看着像出了错

智能追踪裁剪

  • 画框跟随当前讲话人的脸
  • 脸始终在画内,头顶留有余量
  • 人一移动,画面顺滑地跟上去
  • 对话时切到正在说话的那个人
  • 看起来就像一开始就是竖着拍的
差别不在速度,而在于镜头的重点到底在不在画面里。

当16:9变成9:16时会发生什么

看看损失的规模会更有体会。横向1920x1080的画面和纵向1080x1920的画面是两个世界。要在没有黑边的情况下得到真正的9:16,你只能从宽画面里保留一条窄窄的竖直立柱。按宽度算,那只比原图的一半多一点。

~44%
从16:9转到9:16时,原始画面宽度出画的比例,只剩下约56%(Transcriptr)

这正是为什么把这根立柱放在哪里决定了一切。随手放在中央,你扔掉的就不是空白背景而是一张脸。按内容来放、让画框跟着讲话人走,你扔掉的才是背景,而人留在画面里。

智能人脸追踪裁剪如何运作

掀开引擎盖,一套像样的自动重构图并不是魔法,而是一条清晰的流水线。它先在每一帧上找脸(比如用MediaPipe Face Mesh,每张脸最多打上468个点),再判断此刻谁是主角。接着计算竖直画框,让脸落在画内、头顶留出15-20%的余量,最后把画框的运动轨迹平滑处理,好让画面不抖(Transcriptr)。

1找出人脸
2选出活跃的那个
3计算9:16画框
4平滑轨迹
5渲染竖屏
智能裁剪流水线:检测、选主体、裁剪、平滑、渲染。

这里的关键一步是平滑。如果画框追着脑袋的每一个细微动作跑,观众三秒就晕。所以要把轨迹送进一个滤波器(低通或卡尔曼),平滑窗口大约在10-30帧:大的移动照样跟,小的抖动被抑制掉(Transcriptr)。

  • 检测:每一帧上人脸在哪里
  • 追踪:跨帧认出同一个人,画框才不会乱跳
  • 裁剪:一条头顶留白的窄竖框
  • 平滑:一段不生硬跳切的柔和运镜

数据:为什么竖屏真的更胜一筹

这不是口味问题。人们把手机竖着拿,也就竖着看。按业内广泛引用的数据,约94%的智能手机用户看视频时竖着拿手机,而且大多数人不会为一段横屏去转手机(Embryo)。竖屏画面在手机上占据的屏幕面积也比横屏多出大约78%(Sculpt)。

竖着拿手机94%
竖屏占更多屏幕面积78%
静音看视频85%
为什么竖屏和字幕都不是可选项:业内数据(Embryo、Sculpt)。

同样的逻辑也推动着完播率。一项被广泛引用的MediaBrix研究发现,竖屏视频的完播率比横屏高出约90%(Sculpt)。而据近期的平台观察,在竖屏信息流里,一段真正的9:16片段拉动的互动量大约是1:1方形或4:5剪裁的2.3倍(quso.ai)。光是格式对了,数据就已经在动。

还有一件大家总忘的事:约85%的信息流视频是在静音状态下观看的(Sculpt)。所以光有竖屏格式只做了一半。画面里不烧进字幕,观众根本不知道这段讲的是什么,直接划走。

居中裁剪、手动关键帧和追踪

把横屏变成竖屏有三种办法。区分它们的,是你要花多少时间,以及脸能多稳地留在画面里。

居中裁剪手动关键帧智能追踪
讲话人偏在一侧时脸仍在画内
跟随移动✓ 手动✓ 自动
顺滑运镜、不生硬不适用全看手法✓ 平滑
每分钟视频耗时几秒10-30分钟几秒
在讲话人之间切换✓ 手动✓ 自动

手动打关键帧能给出完美结果,前提是你愿意坐下来、沿着整段片子用手拖动裁剪框。一分钟的谈话就是几十次调整。智能追踪几秒钟就能得到几乎一样的质量,因为是算法在驱动画框。

构图直接影响留存

头几秒就是分水岭。在竖屏信息流里观众无休止地划,如果开场一帧里额头被切掉了、或者人已经飘出了边缘,拇指就已经在动了。好的构图能在整段片子里把视线牢牢锁在该在的地方。

100% 看到第一帧
45% 撑过3秒
18% 看完
4% 转发
竖屏信息流里典型的留存漏斗:裁剪影响每一环。
规则很简单:如果第一个镜头里人脸出了画面或被切掉,观众还没听到第一句话就已经流失了。

9:16安全区

就算脸构图得再完美,也可能被平台界面毁掉。TikTok、Reels和Shorts会在你的视频上画自家的按钮、账号名、简介和字幕。标准画布是1080x1920、9:16。把重要内容放得离界面遮挡的边缘远一点(quso.ai)。

  • 底部:把脸和文字放在底部约270 px以上,那里是账号名、简介和音乐
  • 右侧:右边留出约100 px给点赞、评论和分享按钮
  • 顶部:别把字幕顶到最上面,那里有图标和时间
  • 关键内容溢出安全区的片子会损失完播率,据一项估计约22%(quso.ai

Monty是怎么做的

Monty拿你的一条素材,为每个平台各生成一支成片。它用你的声音写脚本,剪辑素材(剪切、配乐、b-roll),加上与你话音同步的字幕,为每个平台单独出一个版本,并发布到Shorts、Reels、TikTok和Telegram。每月3支视频免费。

对横转竖来说,这意味着你不用手动拖裁剪框,也不用把自己塞进安全区。Monty会做出把字幕烧进画面的竖屏版本,并自己发布出去。想要掌控?把审核开着,每支视频都会等你点头。想要自动驾驶?给它排个时间表就行。

竖屏加字幕是2026年的底线。智能裁剪的作用,是在16:9变成9:16时让脸留在画面里,而不是留下他身后那堵墙。

FAQ

我能不能直接把16:9居中裁剪了事?

如果重要的东西正好在正中央、又不动,那可以。但现实里几乎不会这样:讲话人偏在一侧、来回走动,或者画面里有两个人。这时居中裁剪就会切到脸、留下空背景。智能追踪让画框跟着人走,正好解决这个问题。

转成竖屏会损失多少画面?

按宽度算,原始16:9大约保留56%,也就是约44%出了画面。这正是为什么把竖直画框放在哪里很重要:要按内容放,而不是随手放在中央。

如果片子已经是竖屏,还需要字幕吗?

需要。约85%的信息流视频是静音观看的。竖屏格式能抓住注意力,但没有烧进去的字幕,观众抓不到重点就划走了。格式和字幕是一对搭档。

安全区是什么,为什么要在意?

就是平台按钮和字幕不会盖住的那部分画面。在9:16的1080x1920画布上,把重要内容放在底部约270 px以上、右侧约100 px以内,否则界面会挡住脸或文字,完播率就会下降。

来源

  1. 1.面向竖屏视频的AI自动重构图如何运作(Transcriptr)
  2. 2.TikTok尺寸规格2026:规格与安全区指南(quso.ai)
  3. 3.30条竖屏视频数据(Embryo)
  4. 4.如何做好社交媒体上的竖屏视频(Sculpt)
  5. 5.用于内容再利用的最佳自动重构图工具(OpusClip)
分享给朋友Telegram邮件

嘿 Monty。做条短视频。

免费试用 Monty

继续阅读