上周我在交个朋友分享goodcase是如何自动化收集提示语,然后人工和三个模型交叉验证提示语质量的同时,
其实我还在同一个会场摆摊来着。
当然摆摊遇到的物料,大尺寸高清图片,视觉设计啥的我感觉要再办一次才够经验分享出来。但是这次跟路过的所有人介绍goodcase的时候,到执行的那一步还是豆包被提起最多次。
那来吧,刚好我也高强度用一周了,是时候来系统说说,豆包PC目前也可以生成图片和视频,还能切换工作模式当做办公Agent的情况下,能不能当成国产codex来用。
好消息是豆包现在的多端同步。跟Codex,Claude Code都不一样。
Codex那种,本地跑和云端跑是两套分开的环境,你得自己决定派到哪儿,还得先登录,配好token,把环境搭起来,两边文件还不通。
豆包是把本地电脑和云电脑做成了同一个东西,任务派给谁、跑本地还是跑云端,切换一下就行,两边是打通的。还有个小细节,那个云电脑是个Windows虚拟机,如果本机是mac的话还可以做环境互补。
云电脑用最多的肯定就是联网搜索了,
如果你是想要用手机的话,记得登录的时候往左下下下下角看一下,切换成为飞书账号,这样的话才能够读取你所有的数据。
然后就可以零帧起手,来一句经典问句,比方说「AI 的方向风口是哪里?就是有没有什么一些比较新的产品呢?」
以前也不是没折腾过飞书自动化。拿飞书的lark cli去配定时脚本,最烦的就是隔三差五要重新授权。
在豆包里配定时任务,因为它能读到我本地的Skill,也连着飞书,我只要把任务规则写明白,到点自己跑,跑完结果自动同步回飞书,中间不用我再碰一次授权,也不用配任何东西。
而且跟CodeX的那种插件可能部分还需要自己登录的不一样,豆包选了一种别的方法。因为飞书已经内置了很多工具了嘛,所以它其实相当于就是你只需要授权一次飞书,然后飞书里面自带的所有工具,prd,表格,会议预约都可以拿来用了。
这种情况下,如果你跟我一样用的是一台最低配的 Mac mini(只有16G内存和256G存储),豆包就非常适合我这种每个G都很珍贵的场景。
然后再说我这周用到的豆包新体验,
随时插话
这个也是有点类似codex的btw侧边对话的同款能力,上周我试的时候还做不到。但是这个功能还是带完整上下文的。
比方说有一次我给它派了个活,把一份会议录音整理成纪要和待办。它跑着跑着,我发现理解的方向跟我想要的不太一样,纪要写得跟流水账似的。以前遇到这种情况,我只能等它把一整段答案吐完,再重新组织一遍话术派回去。
现在可以直接插一句,
在处理完整文档之前先给我一个快速总结
很快就接上了,顺着我纠正的方向继续跑。
更省心的是,我让它先总结,再继续把完整任务放到后台跑。插完话切走,我继续做自己的事情,它就在后台小窗里跑,不占屏幕也不吵人。等我忙完手头的事切回去,纪要已经按我要的样子躺在那里等我了。
以前用别的Agent,它正跑着的时候想插句话,新消息得先进队列排队,要么你手动加,甚至有的得等它整段跑完才能塞进去。豆包不一样,我按下回车的那一瞬间,就算它旁边还在跑,也能把我最新发的话,自动合并进当前正在跑的任务里,还理解得明明白白。
而且这个能力不是豆包工作独占,连豆包普通的聊天版,现在也能这么干了。
再来,它不只能办公,创作这块也能接上视频图像音乐的生成。
所以你现在完全可以从goodcase里面找一个你想要复现的图片视频什么的丢给豆包去做。
打个比方,每次写文章最头疼的就是找封面,方向老拿不定,图也难找。这周我直接让豆包内置的给我出。我就丢给它一句Prompt, ㅤ
不到三分钟结果就出来了,比codex要快。就算要调细节,也是一句话的事
而且看着还挺好玩的,既然这样...直接封面走起。
除了图片外,还能直接出视频,豆包里常用的图片和视频能力,在Work里也能直接用。
但还是提个醒,其他任务额度消耗都挺少,视频任务的额度消耗会明显更高,这个先说在前面...
还有几个这周顺手发现的小亮点,任务可以分享对话链接,也能跨对话整合信息。
你弄到一半的内容,其他人可以读完继续干,直接把团队没法协作或者Token烧完没记录的事情给解决了。
而且,这还能读本地配置好的Skill,也可以自己做专属Skill,还都是在同一个豆包里完成。
最后的最后,
顺手再说两个我日常挺受用的小技巧。
第一个是PPT。
网上好看的PPT模板很多,但真正想拿来用时,版式、字体、间距和元素位置都得重新对齐,照着复刻很费时间。
但这次我发现,豆包在还原模板这件事上做得还挺好。你给它一张参考图,它基本能把整体版式、配色和视觉风格还原出来,而且里面的元素不是一张死图,还可以继续单独编辑。
我自己觉得,它并不是那种完全1:1的像素级复刻,更像是做到了1:0.9左右。你一眼就能看出来它和原模板是同一套风格,但又不会把每个细节都完全照搬。
反而我觉得这样更实用。很多时候我们看到一个好看的模板,只是觉得这个风格不错,以后可能用得到,但当下还不知道具体要放什么内容。如果完全照着原图复制,之后反而容易被原来的结构限制住。
豆包这种稍微保留一点空间的还原方式,会让你后面改内容、换版式、加自己的东西都更方便。
另一个是识图找信息,
这其实是被一张手写的英文逼出来的。电子版还好,发到邮箱我直接网页翻译,或者扔给翻译软件也就解决了。
手写就真没辙了,复制复制不了,搜也搜不到,先走一遍OCR识别文字,再翻译的话质量只会更差。
后来我想,干脆让豆包工作直接看我拍的图,帮我翻译。
实测下来,不光是工整的手写信能搞定,就连那种弯弯绕绕的连体手写,它也能给你认出来。
那既然识别成功了,那突发奇想来个极限测试,来看一下它的识图功能到底能做到什么程度。
有一个在国外挺火的小游戏,威利在哪里,要从密密麻麻的人群里找到一个戴红色针织帽的人。
我把这张图丢给豆包,与此同时我自己也开始找,硬生生盯了五分多钟,眼睛都快看花了还是没找到。
结果回头一看豆包,它直接把人圈出来给我了,一眼就能看到在哪。
圈选的位置有一点偏,应该是框选的问题。但就凭这个结果,这点小瑕疵我完全可以忽略。
我又把同一张图、同一个任务发给GPT做了一次对比,
结果是出了,但也是豆包先把位置圈出来之后,我才顺着它的描述验证到的。。。就这样我还是盯了半天才找到。
所以你看,这一周的变化其实很具体。
这些散落在不同工具,不同App,不同Agent里的活,现在都收在豆包里,电脑没开机也照样能跑。
说到这儿,我想起之前就一直劝大家趁AI这波版本红利,整一台Mac mini,让它连着云端自己跑。
现在回头看,豆包其实就把这件事给做了,还更省心。某种意义上,它就是放在云端的那台Mac mini,让它读本地文件,ok,让它读线上团队数据,no problem。
我这三年做知识管理有过三次大迁移,
基本是一比一完全深度迁移的那种。
一次是从notion迁到obsidian,
一次是做了飞书和obsidian的双端同步,
再一次就是用mem0和claudemem做了我跟Agent每次对话的记录和多端同步,
基本上就是从不同颗粒度来全自动记录自己,
现在回过头来想想,
花一个月把本地文件同步到飞书是真让我也吃上一波Agent的红利了。
@ 作者 / 卡尔 & yc星辰
最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论
如果想第一时间收到推送,不妨给个星标
如果你有更有趣的玩法,欢迎聊聊
更多的内容正在不断填坑中……
热门跟贴