把一张截图发给 AI,再问一句“这里有什么问题”,看似已经提供了全部信息。实际结果却可能忽好忽坏:文字太小、图片在发送时被压缩、画面方向错误、截图裁掉了关键上下文,或者问题本身没有说明需要检查哪一部分。
图片问答可以拆成三个连续环节:Telegram 传递了什么文件、模型实际看到了哪些视觉线索、用户要求它完成什么任务。任何一环不清楚,回答都可能变得含糊。下面的做法不依赖某一家模型,适合截图、商品照片、表格、图表和一般场景照片。
第一步:先决定发送速度还是保留细节
Telegram 会优化普通照片以加快传输。Telegram 在 2025 年 6 月 3 日的更新中说明,普通照片可节省约 90% 的移动数据;HD 选项提供约 4 倍像素,而完整分辨率照片仍可按原始文件大小发送。
这三种方式没有绝对的优劣,应按任务选择:
- 只想识别主体或了解大致场景时,普通照片通常足够;
- 需要读取菜单、错误信息、标签或较小文字时,优先选择 HD;
- 需要核对精确数字、细线、图例或原始尺寸时,考虑以文件方式发送原图;
- 如果图片包含不必要的个人信息,不要为了追求原图而忽略隐私,先做好遮盖或裁剪。
更高分辨率并不保证答案正确,但过早丢失的细节无法靠后续提示词恢复。发送后可以放大 Telegram 中的实际图片,确认文字和图表仍然清楚,而不是只检查手机相册里的原图。
第二步:裁剪焦点,但不要裁掉判断依据
一张很长的网页截图可能只有右下角的报错值得分析。把目标区域裁得更大,通常比直接发送整张长图更容易阅读。OpenAI 的视觉文档建议放大图片中的小文字;Anthropic 也建议对过大的图片预先缩放或裁剪,因为系统处理时可能再次调整尺寸,让细字变得更难辨认。
裁剪时要同时保留必要上下文。例如:
- 报错截图保留应用名称、操作步骤和完整错误行;
- 表格保留列名、单位、日期和脚注;
- 图表保留标题、横纵轴、图例和时间范围;
- 商品照片保留整体外观,再补一张标签或接口的近照;
- 页面问题保留目标区域,也说明它位于页面顶部、正文还是弹窗。
如果当前界面支持多张图片,可以用“全景图 + 细节图”的组合,并在文字中明确“图 1 是整体,图 2 是右下角放大”。本文不据此承诺 BearChat 在所有会话、模型或套餐中都支持相同的图片数量与尺寸;应以实际界面为准。
第三步:确认方向、清晰度和可读性
Google 的 Gemini 图片理解文档建议使用清晰、不模糊且方向正确的图片。OpenAI 也指出,旋转或倒置的图片可能被误读。Anthropic 进一步提醒,严重压缩会产生伪影,多次 JPEG 压缩尤其可能让文字难以辨认。
发送前可以快速检查:
- 图片是否朝上,文字是否需要旋转;
- 对焦是否准确,有没有手抖或反光;
- 关键文字放大后是否仍能逐字阅读;
- 截图是否经过聊天软件重复转发和压缩;
- 颜色是否承担含义,例如红线、绿线、虚线和实线;
- 关键信息是否被通知条、浮层或马赛克挡住。
Google 还说明,更高的媒体处理分辨率有助于读取细字和小物体,但会增加延迟和资源消耗。这是通用模型接口的取舍,并不表示 BearChat 向用户开放相同的分辨率设置。
第四步:问题要指向具体证据
“分析这张图”没有说明分析目标,模型只能自行猜测。更可靠的提问通常包含四个部分:图片类型、目标区域、希望执行的动作,以及回答格式。
可以这样问:
- “这是 Mac 的报错截图。请先逐字抄出红色提示,再列出三个可能原因;看不清的文字标为不确定。”
- “这是 2026 年第二季度销售图。只比较蓝线和橙线,先写出横纵轴与单位,再解释变化,不要推断图外数据。”
- “这是商品背标。请提取成分、净含量和有效期;如果日期格式有两种解释,请分别说明。”
- “这是设置页面。请指出关闭通知的入口,并描述你依据的按钮文字和相对位置。”
- “请把可直接看到的事实与根据常识做出的推断分成两栏。”
要求模型先说明可见证据,再给结论,可以让读者更容易发现它是否漏看图例、混淆颜色或补出了图片中不存在的内容。对于多张图片,还要逐张编号,避免模型把不同图片的内容合并。
哪些结果必须人工复核
官方视觉模型文档都明确保留了限制。OpenAI 提醒模型可能误读小字、非拉丁文字、旋转画面、图表的颜色与线型、精确位置和物体数量,也可能生成错误描述。Anthropic 同样把低质量小图、精确空间定位、计数和 AI 生成图片识别列为不应直接依赖的场景;Google 则建议对意外、不准确或有偏差的输出进行后处理和人工评估。
因此,以下任务不能只凭一次图片回答作决定:
- 身份证件、合同、发票、订单号和付款金额;
- 药品剂量、医学影像、过敏信息和诊断结论;
- 安全警告、设备故障与高风险操作步骤;
- 图表中的精确读数、对象数量和像素级位置;
- 判断照片是否伪造、是否由 AI 生成,或照片中的人物是谁;
- 任何会影响账户、财产、健康、法律权利或人身安全的结论。
可采用“AI 提取—回看原图—第二来源确认”的流程。必要时让模型引用它看到的具体文字或区域,但引用本身也需要和原图逐项核对。
一分钟发送前清单
在 Telegram 中提交图片前,依次确认:
- 我需要场景概述,还是需要读取细节?
- 普通照片、HD 或原始文件,哪一种更适合这个任务?
- 图片是否清晰、朝上,而且没有重复压缩?
- 裁剪后是否仍保留标题、单位、图例和必要上下文?
- 问题是否指定了目标区域、动作和输出格式?
- 是否要求区分可见事实、不确定内容和推断?
- 是否已经遮盖无关的姓名、账号、地址、二维码和其他敏感信息?
- 如果答案会产生重要后果,我准备怎样人工复核?
把图片理解当作可检查的辅助工具
BearChat 提供 Telegram 内的 AI 图片理解能力。更清晰的图片、更具体的问题和可追溯的复核步骤,能让图片问答更有用,但不能把概率性的模型输出变成绝对事实。
本文引用不同模型与 Telegram 的公开资料,是为了总结通用输入原则;不代表 BearChat 使用其中某个模型,也不表示产品公开了相同的分辨率、图片数量、坐标或压缩控制。当前支持的模型、图片格式、大小和交互方式应以产品页面与实际机器人界面为准。
参考资料
- OpenAI,Images and vision,持续维护文档,访问于 2026 年 10 月 7 日。
- Anthropic,Vision,持续维护文档,访问于 2026 年 10 月 7 日。
- Google AI for Developers,Image understanding,最后更新于 2026 年 9 月 23 日。
- Telegram Team,Direct Messages for Channels, Voice Trimming, Topic Tabs and HD Photos,发布于 2025 年 6 月 3 日。