——基于文本、图片、语音、二维码的智能风险分析体系设计
一、背景
随着人工智能技术的发展,诈骗攻击方式也逐渐智能化。
传统诈骗主要依靠:
- 固定话术;
- 批量短信;
- 明显关键词。
例如:
恭喜中奖,请点击链接领取奖励
通过关键词:
中奖
领取
链接
即可判断风险。
但是近年来诈骗场景发生变化:
1. 诈骗内容更加隐蔽
例如:
诈骗者不会直接说:
立即转账
而会说:
您的账户需要进行安全验证,
请按照客服指导完成操作。
语义上更加自然。
2. 诈骗载体更加多样化
风险信息可能来自:
- 短信;
- 微信聊天;
- 图片截图;
- 电话语音;
- 二维码;
- 网页链接。
因此:
单纯文本分析已经无法满足需求。
在"灵犀安全"项目中,我设计了一套:
面向移动端场景的多模态 AI 反诈分析系统。
核心思想:
将不同来源的信息统一转换为 AI 可理解的数据,再通过 RAG + 大语言模型完成风险判断。
二、为什么需要多模态分析?
传统系统:
文本
↓
规则匹配
↓
风险判断
只能处理:
文字。
但是现实诈骗:
诈骗短信
|
|
聊天截图
|
|
诈骗电话
|
|
二维码
|
|
网页链接
信息来源复杂。
例如:
用户收到一张图片:
XX银行安全认证通知
请扫描二维码完成身份验证
图片本身没有文本输入。
如果系统只能分析文字:
无法发现风险。
因此需要:
图片
↓
视觉理解
↓
文本提取
↓
AI分析
三、系统整体架构
"灵犀安全"多模态分析架构:
用户输入
|
---------------------------------
| | |
文本 图片 音频
| | |
↓ ↓ ↓
文本处理 OCR视觉模型 ASR语音模型
| | |
---------------------------------
|
↓
多模态融合层
|
↓
RAG知识检索
|
↓
LLM推理
|
↓
风险决策输出
四、文本诈骗检测
1. 数据来源
文本主要来自:
系统通知
例如:
微信通知
支付宝通知
短信通知
浏览器通知
通过:
NotificationListenerService
获取。
用户主动检测
例如:
用户复制:
客服让我下载APP退款
提交检测。
五、文本分析流程
完整流程:
用户文本
|
↓
文本清洗
|
↓
Embedding向量化
|
↓
诈骗知识库检索
|
↓
Prompt增强
|
↓
LLM分析
|
↓
风险等级
六、图片诈骗检测
1. 应用场景
常见诈骗:
- 虚假银行截图;
- 假冒官方通知;
- 虚假中奖页面;
- 收款二维码。
例如:
用户上传:
银行账户异常截图
图片中:
点击链接解除冻结
七、OCR文字提取
图片无法直接进入文本模型。
因此:
第一步:
OCR。
流程:
Image
↓
OCR模型
↓
Text
↓
RAG分析
例如:
输入:
图片:
您的账户涉嫌违规
请下载安全软件
OCR输出:
{
"text":
"您的账户涉嫌违规,请下载安全软件"
}
进入:
诈骗检测流程。
八、图片视觉语义分析
仅OCR还不够。
例如:
二维码图片:
可能没有文字。
因此需要:
视觉模型。
模型可以理解:
- 页面布局;
- Logo真假;
- UI仿冒;
- 二维码区域。
例如:
识别:
仿冒支付宝登录页面
输出:
{
"type":
"fake_payment_page",
"risk":
"HIGH"
}
九、语音诈骗检测
近年来:
电话诈骗成为主要风险来源。
典型:
我是公安机关工作人员
你的账户涉嫌犯罪
需要配合调查
传统方式:
无法实时理解。
因此加入:
ASR语音识别。
流程:
Audio
↓
语音识别模型
↓
文本
↓
RAG分析
↓
风险判断
十、语音分析示例
输入:
音频:
请提供你的验证码,
否则账户将被冻结。
ASR:
转换:
请提供你的验证码,否则账户将被冻结
RAG检索:
找到:
冒充客服诈骗案例
冒充公检法案例
LLM:
输出:
{
"riskLevel":
"HIGH",
"reason":
"疑似诱导提供验证码诈骗"
}
十一、二维码风险检测
二维码诈骗越来越常见。
例如:
诈骗者发送:
扫码领取红包
实际:
二维码:
恶意支付链接
检测流程:
二维码图片
↓
二维码解析
↓
URL提取
↓
网址风险检测
↓
AI分析
例如:
解析:
http://xxx-login.com
检测:
- 域名年龄;
- 是否仿冒;
- 是否恶意跳转。
输出:
{
"type":
"malicious_url",
"risk":
"HIGH"
}
十二、URL风险分析模块
对于链接:
不仅看关键词。
例如:
假网站:
https://bank-login-security.com
表面:
像银行。
但是:
分析:
域名注册时间
SSL证书
历史信誉
页面内容
结合:
AI判断。
十三、多模态融合设计
不同模态:
最终需要统一。
例如:
用户收到:
图片:
退款通知截图
同时:
文本:
客服让我扫码
语音:
指导我操作
三个信息结合:
图片风险
+
文本风险
+
语音风险
|
↓
综合判断
十四、多模态Prompt设计
输入:
{
"text":
"客服让我扫码退款",
"image":
"OCR结果",
"audio":
"语音文本"
}
Prompt:
你是一名反诈专家。
请综合分析:
1.文本内容
2.图片信息
3.语音内容
判断是否存在诈骗。
输出:
{
riskLevel:"",
reason:"",
suggestion:""
}
模型输出:
{
"riskLevel":
"HIGH",
"reason":
"存在冒充客服退款诈骗特征",
"suggestion":
"不要扫码,不要提供验证码"
}
十五、与RAG结合
多模态并不是简单调用模型。
核心:
仍然是知识增强。
流程:
多模态输入
|
↓
内容理解
|
↓
向量检索
|
↓
诈骗案例匹配
|
↓
LLM推理
十六、项目中的实际应用
"灵犀安全"设计:
场景1:通知检测
来源:
微信通知。
流程:
NotificationListener
↓
文本分析
↓
RAG
↓
风险提醒
场景2:截图分析
用户:
上传聊天截图。
流程:
图片
↓
OCR
↓
诈骗检测
↓
结果展示
场景3:语音检测
用户:
上传录音。
流程:
音频
↓
ASR
↓
风险分析
↓
报警
十七、性能优化
多模态模型计算量较大。
因此:
1. 异步处理
采用:
上传任务
↓
taskId
↓
后台分析
↓
WebSocket返回
2. 模态分流
不是所有内容都需要大模型。
例如:
普通URL:
直接:
规则检测。
高风险:
进入:
LLM。
3. 分级检测
设计:
三级架构:
第一层:
规则快速过滤
第二层:
机器学习分类
第三层:
大模型深度分析
降低成本。
十八、隐私安全设计
多模态涉及:
图片:
语音:
聊天内容。
必须保护隐私。
数据最小化
只上传:
必要内容。
例如:
银行卡:
处理:
6222********0000
本地预处理
例如:
OCR:
可以:
本地完成。
只上传:
文本结果。
加密传输
使用:
HTTPS
WSS
十九、技术总结
"灵犀安全"通过:
文本理解
+
图片识别
+
语音转换
+
二维码分析
+
URL检测
+
RAG知识增强
+
LLM推理
构建了一套:
面向真实移动场景的多模态智能反诈分析系统。
相比传统方案:
| 传统反诈 | 多模态AI反诈 |
|---|---|
| 关键词匹配 | 语义理解 |
| 单文本分析 | 多源信息融合 |
| 人工维护规则 | 知识库增强 |
| 被动检测 | 主动感知 |
| 固定策略 | 智能推理 |
总结
未来安全应用的发展方向,不只是:
"检测诈骗"。
而是:
理解用户正在面对什么
↓
结合历史诈骗知识
↓
提前预测风险
↓
主动保护用户
多模态大模型让移动安全应用从:
规则驱动
走向:
智能决策驱动。