基于 RAG 的实时反诈大模型系统设计与实现

灵犀安全 · 检索增强生成架构

一、背景

近年来,电信诈骗呈现出高度复杂化趋势:

传统反诈系统通常采用:

关键词规则
      |
      ↓
风险判断

例如:

检测:

转账
银行卡
验证码
点击链接

出现这些关键词后提高风险等级。

但是这种方式存在明显不足:

1. 语义理解能力不足

例如:

你的账户存在异常,请立即联系客服解决

没有明显诈骗关键词。

但是结合上下文:

客服要求下载远程控制软件

实际上已经高度疑似诈骗。

2. 无法适应新型诈骗

诈骗话术每天变化。

规则库需要不断人工维护。


因此,在"灵犀安全"项目中,引入:

RAG(Retrieval Augmented Generation,检索增强生成)

架构。

利用:

知识库
+
向量检索
+
大语言模型

实现更加智能的风险判断。


二、系统整体架构

整体架构如下:

                  用户设备

                     |
                     |

          NotificationListener

                     |

             风险内容采集层

                     |

                     ↓


              RAG分析服务

                     |

        ------------------------

        |                      |

    向量数据库             LLM模型

        |                      |

        -----------+------------

                    |

              风险决策结果

                    |

              WebSocket推送

                    |

          App实时安全提醒

三、为什么选择 RAG 架构?

传统大模型:

用户输入

 ↓

LLM

 ↓

回答

问题:

模型不知道最新诈骗案例。

例如:

2026年出现的新型诈骗:

AI数字人冒充银行客服

模型训练数据可能没有。


RAG:

增加外部知识库:

用户输入

 ↓

知识检索

 ↓

相关诈骗案例

 ↓

拼接Prompt

 ↓

LLM分析

 ↓

结果输出

因此模型拥有:


四、诈骗知识库设计

1. 数据来源

知识库主要包括:

诈骗案例库

例如:

案例ID:
10001

类型:
冒充客服诈骗

描述:

骗子冒充电商客服,
诱导用户开启屏幕共享。

风险等级:
HIGH

关键词:

屏幕共享
退款
验证码

风险规则库

例如:

规则:

如果出现:

远程控制软件
+
转账要求

风险等级:
HIGH

安全建议库

例如:

风险:

HIGH


建议:

立即停止操作,
不要点击链接,
联系官方渠道确认。

五、文本向量化

RAG核心:

将文本转换成向量。

例如:

诈骗案例:

客服要求退款,需要下载会议软件

经过Embedding模型:

得到:

[0.123,
0.542,
0.876,
...
]

存入向量数据库。


用户输入:

客服让我下载软件退款

同样转换:

[0.120,
0.550,
0.870,
...
]

计算相似度:

用户文本

       ↓

向量距离计算

       ↓

找到相似案例

六、向量数据库设计

系统采用:

Embedding
+
Vector Database

结构。

数据:

{
"id":"case_10001",

"text":
"冒充客服退款诈骗",

"vector":
[
0.23,
0.54,
0.78
],


"metadata":{

"type":
"customer_service",

"level":
"HIGH"

}

}

检索:

用户输入:

退款需要验证码

返回:

案例1:
冒充客服诈骗

相似度:
0.93


案例2:
验证码盗取

相似度:
0.87

七、RAG分析流程设计

完整流程:

用户内容

    |

    ↓

文本预处理

    |

    ↓

Embedding向量化

    |

    ↓

知识库检索

    |

    ↓

生成增强Prompt

    |

    ↓

LLM分析

    |

    ↓

风险结果

八、Prompt工程设计

为了让模型输出稳定结果,需要限制输出格式。

Prompt:

你是一名专业反诈分析助手。

请根据:

1. 用户输入内容
2. 检索到的诈骗案例

判断风险等级。


输出JSON:

{
riskLevel:"",
reason:"",
suggestion:""
}

等级:

HIGH:
明确诈骗风险

MEDIUM:
存在可疑行为

LOW:
正常信息

模型输出:

{
"riskLevel":"HIGH",

"reason":
"疑似冒充客服退款诈骗",

"suggestion":
"不要提供验证码"
}

九、多模态 RAG 设计

在项目中,不仅支持文本。

还设计:

文本

图片

音频

二维码

网址

多入口分析。


1. 文本分析

输入:

短信内容

聊天内容

通知内容

流程:

Text

↓

Embedding

↓

RAG

↓

LLM

2. 图片分析

例如:

用户截图:

中奖通知截图

付款二维码截图

流程:

Image

↓

OCR

↓

文本提取

↓

RAG分析

3. 音频分析

诈骗电话:

您好,我们是公安机关

流程:

Audio

↓

ASR语音识别

↓

Text

↓

RAG

十、异步任务架构设计

由于大模型分析耗时较长:

可能:

3s~30s

不能阻塞HTTP请求。

因此采用:

异步任务模式。


客户端:

请求:

POST

/api/v1/fraud-detect/analyzeContent

提交:

{

"type":"text",

"content":
"客服让我退款"

}

服务器:

立即返回:

{

"taskId":
"abc123"

}

后台:

任务队列

↓

RAG分析

↓

保存结果

↓

通知客户端

十一、WebSocket实时结果推送

为什么不用轮询?

传统:

客户端

每隔5秒请求一次

服务器

有没有结果?

缺点:


采用:

WebSocket:

客户端

保持长连接

        ↑

        |

服务器主动推送

消息格式:

{

"type":
"RAG_RESULT",

"taskId":
"abc123",

"riskLevel":
"HIGH",

"content":
"发现诈骗风险"

}

十二、风险等级处理策略

系统定义:

HIGH

高风险:

例如:

处理:

弹窗

+

语音报警

+

通知守护人

MEDIUM

中风险:

例如:

处理:

提醒用户注意

LOW

低风险:

正常信息:

记录分析结果

十三、守护人联动设计

"灵犀安全"的特色功能:

家庭守护。

流程:

用户风险触发

        |

        ↓

RAG判断HIGH

        |

        ↓

WebSocket通知

        |

        ↓

绑定守护人收到提醒

例如:

老人收到诈骗短信:

老人手机

↓

AI检测

↓

风险确认

↓

子女手机收到提醒

十四、系统性能优化

1. 异步处理

避免:

HTTP请求等待模型

采用:

MQ任务队列

2. 缓存热点案例

例如:

热门诈骗:

刷单诈骗

冒充客服

虚假投资

提前缓存。


3. 限制上下文长度

RAG检索:

只返回:

Top-K

例如:

Top 5相关案例

避免Prompt过长。


十五、安全设计

数据脱敏

例如:

银行卡:

6222 8888 9999 0000

↓

****0000

权限控制

用户:

只能查看:

自己的风险记录。

守护人:

只能接收:

授权用户风险提醒。


十六、技术总结

"灵犀安全"反诈系统通过:

Android系统感知

        +

UniApp跨端开发

        +

RAG知识增强

        +

LLM智能推理

        +

WebSocket实时通信

构建了一套:

面向移动端场景的实时智能反诈防护系统。

相比传统规则系统:

传统方案 RAG方案
关键词匹配 语义理解
人工维护规则 自动结合知识库
单文本分析 多模态分析
被动检测 主动预警
固定策略 动态推理

最终实现:

诈骗发生

↓

系统感知

↓

AI分析

↓

实时提醒

↓

家庭守护

从而实现真正意义上的:

智能化、主动式、实时反诈防护。

← 返回首页