横屏转竖屏:智能人脸追踪裁剪,而非死板的居中裁剪
把16:9转成适配Reels、Shorts和TikTok的9:16,还不砍掉人头。智能人脸追踪裁剪如何运作、真实数据以及安全区。
你手上有一段横屏素材:一次采访、一场网络研讨会、一段播客、或是用相机拍的东西。而平台想要的是竖屏。Reels、Shorts和TikTok在手机上全屏播放,这个比例就是9:16。最快的转换方法是居中裁剪,最快毁掉它的方法同样是居中裁剪。
咱们来拆解一下:为什么死板的居中裁剪偏偏切掉了最重要的部分,智能人脸追踪裁剪到底怎么运作,以及支撑「竖屏在手机上真的更抓眼球」这一说法的数据是什么。
为什么居中裁剪是个坏主意
当你从一帧16:9里切出一条9:16的竖带时,你就实实在在地扔掉了两侧。原始画面宽度只剩下大约56%,其余的都出了画面(Transcriptr)。如果你把裁剪框钉在正中央、一动不动,任何偏离中心站着的人都会丢掉半张脸。讲话的人走向白板就消失了。两个人对话,画面里只剩他们之间的一堵空墙。
居中裁剪对内容一无所知。它只是切出矩形的几何正中,而视频里重要的部分几乎从不老老实实待在正当中。
死板的居中裁剪
- 裁剪框钉死在画面中央
- 偏在一侧的讲话人被切成两半
- 人一动,画面纹丝不动
- 两人对话变成一堵空墙
- 快是快,但看着像出了错
智能追踪裁剪
- 画框跟随当前讲话人的脸
- 脸始终在画内,头顶留有余量
- 人一移动,画面顺滑地跟上去
- 对话时切到正在说话的那个人
- 看起来就像一开始就是竖着拍的
当16:9变成9:16时会发生什么
看看损失的规模会更有体会。横向1920x1080的画面和纵向1080x1920的画面是两个世界。要在没有黑边的情况下得到真正的9:16,你只能从宽画面里保留一条窄窄的竖直立柱。按宽度算,那只比原图的一半多一点。
这正是为什么把这根立柱放在哪里决定了一切。随手放在中央,你扔掉的就不是空白背景而是一张脸。按内容来放、让画框跟着讲话人走,你扔掉的才是背景,而人留在画面里。
智能人脸追踪裁剪如何运作
掀开引擎盖,一套像样的自动重构图并不是魔法,而是一条清晰的流水线。它先在每一帧上找脸(比如用MediaPipe Face Mesh,每张脸最多打上468个点),再判断此刻谁是主角。接着计算竖直画框,让脸落在画内、头顶留出15-20%的余量,最后把画框的运动轨迹平滑处理,好让画面不抖(Transcriptr)。
这里的关键一步是平滑。如果画框追着脑袋的每一个细微动作跑,观众三秒就晕。所以要把轨迹送进一个滤波器(低通或卡尔曼),平滑窗口大约在10-30帧:大的移动照样跟,小的抖动被抑制掉(Transcriptr)。
- 检测:每一帧上人脸在哪里
- 追踪:跨帧认出同一个人,画框才不会乱跳
- 裁剪:一条头顶留白的窄竖框
- 平滑:一段不生硬跳切的柔和运镜
数据:为什么竖屏真的更胜一筹
这不是口味问题。人们把手机竖着拿,也就竖着看。按业内广泛引用的数据,约94%的智能手机用户看视频时竖着拿手机,而且大多数人不会为一段横屏去转手机(Embryo)。竖屏画面在手机上占据的屏幕面积也比横屏多出大约78%(Sculpt)。
同样的逻辑也推动着完播率。一项被广泛引用的MediaBrix研究发现,竖屏视频的完播率比横屏高出约90%(Sculpt)。而据近期的平台观察,在竖屏信息流里,一段真正的9:16片段拉动的互动量大约是1:1方形或4:5剪裁的2.3倍(quso.ai)。光是格式对了,数据就已经在动。
还有一件大家总忘的事:约85%的信息流视频是在静音状态下观看的(Sculpt)。所以光有竖屏格式只做了一半。画面里不烧进字幕,观众根本不知道这段讲的是什么,直接划走。
居中裁剪、手动关键帧和追踪
把横屏变成竖屏有三种办法。区分它们的,是你要花多少时间,以及脸能多稳地留在画面里。
| 居中裁剪 | 手动关键帧 | 智能追踪 | |
|---|---|---|---|
| 讲话人偏在一侧时脸仍在画内 | ✗ | ✓ | ✓ |
| 跟随移动 | ✗ | ✓ 手动 | ✓ 自动 |
| 顺滑运镜、不生硬 | 不适用 | 全看手法 | ✓ 平滑 |
| 每分钟视频耗时 | 几秒 | 10-30分钟 | 几秒 |
| 在讲话人之间切换 | ✗ | ✓ 手动 | ✓ 自动 |
手动打关键帧能给出完美结果,前提是你愿意坐下来、沿着整段片子用手拖动裁剪框。一分钟的谈话就是几十次调整。智能追踪几秒钟就能得到几乎一样的质量,因为是算法在驱动画框。
构图直接影响留存
头几秒就是分水岭。在竖屏信息流里观众无休止地划,如果开场一帧里额头被切掉了、或者人已经飘出了边缘,拇指就已经在动了。好的构图能在整段片子里把视线牢牢锁在该在的地方。
9:16安全区
就算脸构图得再完美,也可能被平台界面毁掉。TikTok、Reels和Shorts会在你的视频上画自家的按钮、账号名、简介和字幕。标准画布是1080x1920、9:16。把重要内容放得离界面遮挡的边缘远一点(quso.ai)。
- 底部:把脸和文字放在底部约270 px以上,那里是账号名、简介和音乐
- 右侧:右边留出约100 px给点赞、评论和分享按钮
- 顶部:别把字幕顶到最上面,那里有图标和时间
- 关键内容溢出安全区的片子会损失完播率,据一项估计约22%(quso.ai)
Monty是怎么做的
Monty拿你的一条素材,为每个平台各生成一支成片。它用你的声音写脚本,剪辑素材(剪切、配乐、b-roll),加上与你话音同步的字幕,为每个平台单独出一个版本,并发布到Shorts、Reels、TikTok和Telegram。每月3支视频免费。
对横转竖来说,这意味着你不用手动拖裁剪框,也不用把自己塞进安全区。Monty会做出把字幕烧进画面的竖屏版本,并自己发布出去。想要掌控?把审核开着,每支视频都会等你点头。想要自动驾驶?给它排个时间表就行。
FAQ
我能不能直接把16:9居中裁剪了事?
如果重要的东西正好在正中央、又不动,那可以。但现实里几乎不会这样:讲话人偏在一侧、来回走动,或者画面里有两个人。这时居中裁剪就会切到脸、留下空背景。智能追踪让画框跟着人走,正好解决这个问题。
转成竖屏会损失多少画面?
按宽度算,原始16:9大约保留56%,也就是约44%出了画面。这正是为什么把竖直画框放在哪里很重要:要按内容放,而不是随手放在中央。
如果片子已经是竖屏,还需要字幕吗?
需要。约85%的信息流视频是静音观看的。竖屏格式能抓住注意力,但没有烧进去的字幕,观众抓不到重点就划走了。格式和字幕是一对搭档。
安全区是什么,为什么要在意?
就是平台按钮和字幕不会盖住的那部分画面。在9:16的1080x1920画布上,把重要内容放在底部约270 px以上、右侧约100 px以内,否则界面会挡住脸或文字,完播率就会下降。
来源
嘿 Monty。做条短视频。
免费试用 Monty继续阅读
AI 短视频生成器:为什么它该从你的素材出发,而不是模板
AI 短视频生成器分为模板填充型和素材优先型两类。本文讲清模板适用的场景、个人品牌为何需要真实素材,以及一条素材如何变成一条已发布的短视频。
自动发布到 Telegram,把视频一键分发到每个平台
如何把一条视频同时发到 Telegram、Reels、Shorts 和 TikTok。无需手动重复上传的跨平台分发,让 Telegram 成为一等平台。
字幕最佳字体,以及为什么字体不是重点
Reels 和 Shorts 字幕该用什么字体:200 万条视频的数据、真正决定可读性的规则,以及当所有人都在用 Montserrat 时如何脱颖而出。