谷歌 Gemini 能一边看视频一边给你讲里面多模掉感欧博官网手机版的梗,那事第一次试的时分还实愣了一下。随手拍张厨房乱糟糟的照片问它“早饭能吃啥”,它认出了半颗白菜、两根蔫掉的葱,还给了个拌面方子。

多模态 AI 就是何等,不再是态A图说只会背书的书痴人。它起头长眼睛、长耳朵了。前几年 AI 根柢是单科选手吧?图像模子埋头认猫认狗,语音模子一门心机转文字,谁也不理睬谁啊?多模态把中间那堵墙拆了是文字、图片、音频话正、视频塞进统一个年夜脑里做对齐锻炼。听着像手艺黑话,用起来挺曲白。

你截个图丢过去的,它。不光看得懂画面,还看得懂图里那止报错代码正在骂什么啊?

身边做设念的朋友曾经正在用它改稿子。客户说“那个蓝色再暖一点”,她圈出那块区域。

AI 随手甩来三版配色正拆。以前那活得来回磨五六轮,如今两杯咖啡的功夫收工。

科技好玩的地方就正在那儿,它不声不响地把某些重复劳动从你手里抠走了,你还来不及感开感动它。别急着把它捧上天了。上周我让它看一张超市小票。金额那栏硬是被读成了 8 和 3 的合体,算出的总价差了十几块吧?多模态 AI 正在细粒度识别上仍然犯含混的,图文,一旦对齐错位,回覆殉国正词宽地乱说八道。

参数堆得再高。那种“自疑的错觉”都是眼下最实正在的短板。

实正值得盯着的,就是那些感官什么时分能稳到让人懒得复核啊?等哪天你拍张照就问、对着摄像头就说呢?不用几回考据吧?ai 科技才算实正混进了日常。

多模态那条路才走了一小段,后面的热闹,估量好比今看到的还有意义。