# 接入大数据与边缘计算

数据需要进入数据湖做长期分析，或上报量较大、需要先在边缘过滤与聚合时，使用这一类北向应用。

## 两条路径

EMQX Neuron 将数据送入大数据平台有两种方式，可同时存在：

| 路径 | 方式 | 适用情形 |
| --- | --- | --- |
| **北向 Kafka 应用** | 由 Kafka 节点作为生产者，将订阅的南向数据直接发送至 Broker 与 Topic | 采集层已与订阅模型对齐，希望独立控制发送节奏与 Topic 路由 |
| **数据处理 → 动作 (Sink)** | 南向数据先进入[数据处理](../../streaming-processing/overview.md)引擎，经 SQL 过滤、映射、聚合后写出 | 需要在边缘删减字段、降采样或按条件上报 |

## 边缘处理的适用情形

高频采集的原始数据全量上云，成本集中在上行带宽、云端存储与云端计算三处。以下情形建议先在边缘处理：

- **采集频率远高于业务需要**——100 毫秒采集一次是为了不遗漏瞬变，而报表只需分钟级均值。经时间窗口聚合后上报，数据量可降两个数量级。
- **数值长时间不变**——设备稳态运行时点位值基本不动。通过条件过滤，仅在变化超过阈值时上报。
- **告警需要秒级响应**——判断逻辑置于边缘，不必等待云端往返，断网期间仍然有效。
- **上报前需统一单位或字段名**——在边缘完成一次，胜过在每个下游系统各做一次。

规则引擎提供 160+ 个 SQL 函数，覆盖过滤、类型转换、聚合与时间窗口计算；SQL 无法表达的逻辑可用 Python 或 C/C++ 扩展。

## 可写入的目标

除 Kafka 外，数据处理的[动作 (Sink)](../../streaming-processing/sink/sink.md) 还可直接写入：

| 类别 | 目标 |
| --- | --- |
| 数据库 | MySQL、PostgreSQL、SQL Server、Oracle 等（SQL Sink） |
| 时序库 | InfluxDB V1 / V2 |
| 缓存与消息 | Redis、MQTT、Kafka |
| 对象存储与文件 | AWS S3、本地文件、图片 |
| 接口 | REST 调用 |

## 选择应用

| 应用 | 适用情形 |
| --- | --- |
| [Kafka](./kafka/overview.md) | 作为 Kafka 生产者将数据写入 Topic，进入大数据平台。支持 SASL 认证与 SSL/TLS 加密，也可对接 Microsoft Fabric Eventstream |
| [规则引擎应用](./ekuiper/overview.md) | EMQX Neuron 内部节点，将南向数据送入数据处理引擎的 `neuronStream` 流。该应用默认已存在，只需添加订阅 |

::: tip
规则处理后的结果可通过 Neuron 动作反写回设备，构成「采集 → 判断 → 控制」的边缘闭环，见 [Neuron 动作](../../streaming-processing/sink/neuron.md)。
:::
