多模态大模型在反诈场景中的应用探索

灵犀安全 · 基于文本、图片、语音、二维码的智能风险分析体系设计

——基于文本、图片、语音、二维码的智能风险分析体系设计


一、背景

随着人工智能技术的发展,诈骗攻击方式也逐渐智能化。

传统诈骗主要依靠:

例如:

恭喜中奖,请点击链接领取奖励

通过关键词:

中奖
领取
链接

即可判断风险。

但是近年来诈骗场景发生变化:


1. 诈骗内容更加隐蔽

例如:

诈骗者不会直接说:

立即转账

而会说:

您的账户需要进行安全验证,
请按照客服指导完成操作。

语义上更加自然。


2. 诈骗载体更加多样化

风险信息可能来自:

因此:

单纯文本分析已经无法满足需求。


在"灵犀安全"项目中,我设计了一套:

面向移动端场景的多模态 AI 反诈分析系统。

核心思想:

将不同来源的信息统一转换为 AI 可理解的数据,再通过 RAG + 大语言模型完成风险判断。


二、为什么需要多模态分析?

传统系统:

文本

↓

规则匹配

↓

风险判断

只能处理:

文字。

但是现实诈骗:

诈骗短信
      |
      |
聊天截图
      |
      |
诈骗电话
      |
      |
二维码
      |
      |
网页链接

信息来源复杂。


例如:

用户收到一张图片:

XX银行安全认证通知

请扫描二维码完成身份验证

图片本身没有文本输入。

如果系统只能分析文字:

无法发现风险。

因此需要:

图片

↓

视觉理解

↓

文本提取

↓

AI分析

三、系统整体架构

"灵犀安全"多模态分析架构:

                    用户输入


                         |

       ---------------------------------

       |              |              |

     文本           图片           音频

       |              |              |

       ↓              ↓              ↓


  文本处理       OCR视觉模型     ASR语音模型


       |              |              |

       ---------------------------------

                         |

                         ↓


                 多模态融合层


                         |

                         ↓


                  RAG知识检索


                         |

                         ↓


                    LLM推理


                         |

                         ↓


                  风险决策输出

四、文本诈骗检测

1. 数据来源

文本主要来自:

系统通知

例如:

微信通知

支付宝通知

短信通知

浏览器通知

通过:

NotificationListenerService

获取。


用户主动检测

例如:

用户复制:

客服让我下载APP退款

提交检测。


五、文本分析流程

完整流程:

用户文本

    |

    ↓

文本清洗

    |

    ↓

Embedding向量化

    |

    ↓

诈骗知识库检索

    |

    ↓

Prompt增强

    |

    ↓

LLM分析

    |

    ↓

风险等级

六、图片诈骗检测

1. 应用场景

常见诈骗:

例如:

用户上传:

银行账户异常截图

图片中:

点击链接解除冻结

七、OCR文字提取

图片无法直接进入文本模型。

因此:

第一步:

OCR。

流程:

Image

↓

OCR模型

↓

Text

↓

RAG分析

例如:

输入:

图片:

您的账户涉嫌违规

请下载安全软件

OCR输出:

{
"text":
"您的账户涉嫌违规,请下载安全软件"
}

进入:

诈骗检测流程。


八、图片视觉语义分析

仅OCR还不够。

例如:

二维码图片:

可能没有文字。

因此需要:

视觉模型。

模型可以理解:

例如:

识别:

仿冒支付宝登录页面

输出:

{
"type":
"fake_payment_page",

"risk":
"HIGH"
}

九、语音诈骗检测

近年来:

电话诈骗成为主要风险来源。

典型:

我是公安机关工作人员

你的账户涉嫌犯罪

需要配合调查

传统方式:

无法实时理解。

因此加入:

ASR语音识别。

流程:

Audio

↓

语音识别模型

↓

文本

↓

RAG分析

↓

风险判断

十、语音分析示例

输入:

音频:

请提供你的验证码,
否则账户将被冻结。

ASR:

转换:

请提供你的验证码,否则账户将被冻结

RAG检索:

找到:

冒充客服诈骗案例

冒充公检法案例

LLM:

输出:

{
"riskLevel":
"HIGH",

"reason":
"疑似诱导提供验证码诈骗"
}

十一、二维码风险检测

二维码诈骗越来越常见。

例如:

诈骗者发送:

扫码领取红包

实际:

二维码:

恶意支付链接

检测流程:

二维码图片

↓

二维码解析

↓

URL提取

↓

网址风险检测

↓

AI分析

例如:

解析:

http://xxx-login.com

检测:

输出:

{
"type":
"malicious_url",

"risk":
"HIGH"
}

十二、URL风险分析模块

对于链接:

不仅看关键词。

例如:

假网站:

https://bank-login-security.com

表面:

像银行。

但是:

分析:

域名注册时间

SSL证书

历史信誉

页面内容

结合:

AI判断。


十三、多模态融合设计

不同模态:

最终需要统一。

例如:

用户收到:

图片:

退款通知截图

同时:

文本:

客服让我扫码

语音:

指导我操作

三个信息结合:

图片风险

+

文本风险

+

语音风险

        |

        ↓

综合判断

十四、多模态Prompt设计

输入:

{
"text":
"客服让我扫码退款",

"image":
"OCR结果",

"audio":
"语音文本"
}

Prompt:

你是一名反诈专家。

请综合分析:

1.文本内容
2.图片信息
3.语音内容

判断是否存在诈骗。

输出:

{
riskLevel:"",
reason:"",
suggestion:""
}

模型输出:

{
"riskLevel":
"HIGH",

"reason":
"存在冒充客服退款诈骗特征",

"suggestion":
"不要扫码,不要提供验证码"
}

十五、与RAG结合

多模态并不是简单调用模型。

核心:

仍然是知识增强。

流程:

多模态输入

       |

       ↓

内容理解

       |

       ↓

向量检索

       |

       ↓

诈骗案例匹配

       |

       ↓

LLM推理

十六、项目中的实际应用

"灵犀安全"设计:

场景1:通知检测

来源:

微信通知。

流程:

NotificationListener

↓

文本分析

↓

RAG

↓

风险提醒

场景2:截图分析

用户:

上传聊天截图。

流程:

图片

↓

OCR

↓

诈骗检测

↓

结果展示

场景3:语音检测

用户:

上传录音。

流程:

音频

↓

ASR

↓

风险分析

↓

报警

十七、性能优化

多模态模型计算量较大。

因此:

1. 异步处理

采用:

上传任务

↓

taskId

↓

后台分析

↓

WebSocket返回

2. 模态分流

不是所有内容都需要大模型。

例如:

普通URL:

直接:

规则检测。

高风险:

进入:

LLM。


3. 分级检测

设计:

三级架构:

第一层:

规则快速过滤


第二层:

机器学习分类


第三层:

大模型深度分析

降低成本。


十八、隐私安全设计

多模态涉及:

图片:

语音:

聊天内容。

必须保护隐私。


数据最小化

只上传:

必要内容。

例如:

银行卡:

处理:

6222********0000

本地预处理

例如:

OCR:

可以:

本地完成。

只上传:

文本结果。


加密传输

使用:

HTTPS

WSS

十九、技术总结

"灵犀安全"通过:

文本理解

+

图片识别

+

语音转换

+

二维码分析

+

URL检测

+

RAG知识增强

+

LLM推理

构建了一套:

面向真实移动场景的多模态智能反诈分析系统。

相比传统方案:

传统反诈 多模态AI反诈
关键词匹配 语义理解
单文本分析 多源信息融合
人工维护规则 知识库增强
被动检测 主动感知
固定策略 智能推理

总结

未来安全应用的发展方向,不只是:

"检测诈骗"。

而是:

理解用户正在面对什么

↓

结合历史诈骗知识

↓

提前预测风险

↓

主动保护用户

多模态大模型让移动安全应用从:

规则驱动

走向:

智能决策驱动。

← 返回首页