多模态理解与联网搜索
这一节讲小云雀的两项"放大器"能力:多模态理解是让它不光读文字,还能看懂图片、截图、图表;联网搜索是让它接上互联网,回答那些需要最新信息的问题。两项能力用对了,小云雀就从"聊天机器人"变成"能看会查的助理"。
多模态理解:发图给它看
你可以直接发图片给小云雀提问,它能识别图里的内容、文字和图表数据。常见用法:
| 你上传的图 | 可以这样问 |
|---|---|
| 菜单、价目表 | "这张菜单里最贵的三道菜是什么?用表格列出来" |
| PPT 截图、笔记照片 | "把这张图里的文字转成可编辑的文字,并整理成要点" |
| 数据图表 | "这个柱状图说明了什么趋势?帮我用三句话总结" |
| 报错截图 | "这个报错是什么意思?可能的原因和解决步骤是什么" |
| 实物照片 | "帮我描述这张图里有什么,并判断拍摄场景" |
关键技巧还是那句话:发图一定要配问题。只丢一张图过去,它不知道你想让它干嘛,往往只能泛泛描述。图+一句明确的任务,效果立刻不同。
联网搜索:让它去查最新信息
大模型本身的知识有截止时间,遇到下面这些问题,就该让它联网:
- 新闻动态:最近发布了什么新产品、新政策;
- 实时数据:天气、汇率、股价、票房;
- 需要核实的事实:某公司最新动态、某活动报名时间;
- 资料汇总:"近一个月 AI 行业有哪些重要发布,帮我整理成清单"。
提示词里可以直接说"请联网搜索并整理",并要求"标注信息来源和时间"(联网功能的具体入口与可用范围【待确认】,以界面实际为准)。这样得到的结果才有依据,而不是模型凭印象编的。
两项能力怎么配合用
真正高效的是组合拳:
例子一:拍一张竞品宣传单 → 上传 → "联网查一下这家机构的背景,再结合这张宣传单,帮我做一份竞品分析表。"
例子二:发一张行业趋势图 → "基于这张图的数据趋势,联网补充最新一年的情况,帮我写一段 200 字的解读。"
使用时的三条纪律
- 识图结果要复核:图里的数字、小字可能认错,关键数据务必对着原图再看一眼。
- 联网答案要看来源:让它给出来源链接,重要信息自己点进去核实,别把营销号当权威。
- 别上传敏感隐私:含身份证、密码、合同机密的图片,上传前三思,养成保护隐私的习惯(详见第八章安全与隐私)。
小提示:小云雀目前是否支持图像生成、语音输入等能力,随版本演进【待确认】,本手册只讲已明确的"看懂图片、联网搜索"方向,新功能以产品内实际提供为准。
一个组合实战:从一张图到一份简报
把两项能力串起来,看一个完整流程:你在群里看到一张"行业用户增长曲线图"的截图,想就此写一段给领导的简短汇报。
- 先把截图发给它:"这张图展示的是哪几个数据系列?过去一年的整体趋势是什么?"
- 再让它联网:"请联网补充这个领域最新的两个动态,看看和图里的趋势是否吻合。"
- 最后:"结合图表和最新动态,帮我写一段 150 字的口头汇报,先给结论。"
一张图加几句追问,一份有数据、有外部印证、有结论的简报就成型了——这正是多模态加联网两件套的威力。
记住能力的边界
最后再强调一次:多模态和联网都很强,但它们是"帮你整理信息",不是"替你拍板"。图看错了、网上信息鱼龙混杂,都是可能发生的事。重要场合,来源要可信、数据要复核、隐私要保护。把这三条纪律刻在脑子里,这两项能力才能真正为你所用。
到这里,第四章的五大核心功能——对话问答、写作润色、文档解析、翻译学习、多模态与联网——就全部讲完了。你已经知道每把"刀"是干什么的、该在什么场景用。下一章我们走进办公与创作的真实场景,看看怎么把这些功能拼成完整的工作流。