拍照问答与写作场景:对话式助理能多做什么
本篇从真实使用场景出发,对比"指令式语音助理"与"对话式 AI"的差别:哪些事原来做不到、装上 Gemini 之后可以怎么完成。获取方式与机型要求见 GoogleGemini 介绍站。
拍照提问:把镜头当输入法
语音助理听懂的是"话",Gemini 还能"看":
- 认实物:对着一栋建筑、一种植物、一台不认识的设备拍照,直接问"这是谁设计的""怎么保养";
- 解题与翻译:把题目或外文菜单拍下来,让它解释思路或翻译内容;
- 就屏幕内容提问:在任何应用界面唤起 Gemini,选择"针对屏幕内容提问",商品参数对比、长文摘要都不用先截屏。
相机入口就在聊天输入框旁边,拍完可以用语音继续追问,一个话题聊到底。
写作与改写:逐轮磨到能用
写作是差异最大的场景之一:
- 起草感谢信、请假条、活动通知,说明场合与语气即可出初稿;
- 追加一句"语气正式一点""压缩到 100 字",它在原文基础上继续改,不必重来;
- 头脑风暴时让它一次给多个方向的方案,再挑一个往深里聊。
原来的语音助理对这类请求通常只能转到搜索结果;对话式 AI 给的是成稿。
总结与整理:把长内容压短
- 邮件与文档:让它概括 Gmail 里的长邮件、云端硬盘里的文档要点;
- 指定格式:可以要求输出成列表、表格,方便直接抄进笔记;
- 开放话题:解释一个概念后可以连续追问,上下文一直都在。
生成图片与行程规划
- 描述一个画面就能在对话里生成配图,聊天素材、简单海报不必另开工具;
- 让它结合地图与机票信息排旅行计划,改动行程时直接说改哪里。
期望管理:它仍会出错
对话式能力越强,越要记得核对:回复通常附带来源链接,重要决定前点开看一下;医疗、法律、财务类问题只作参考。部分语言与地区的能力范围有差异,具体以应用内实际表现为准。
这些场景都建立在应用装好、账号登录的基础上;安装环节遇到问题,接着看下一篇排查清单。