语言学习应用的隐私问题
大多数语言学习应用收集的数据远超其核心功能所需。通常会收集什么?
- 学习行为:学了哪些单词以及何时学的,练习时长
- 内容:输入的文本常被用于AI训练
- 设备信息:GPS、设备ID、已安装的应用
- 使用档案:何时打开应用、停留时长
- 画像数据:用于用户画像的行为档案
这些数据被用于建立用户档案,出售给第三方、进行A/B测试。即使应用"免费",您也在用数据付费。
DopaSpeak 不收集这些数据中的任何一项
DopaSpeak 自身没有任何收集您使用数据的服务器。它是一款可以在您的设备本地运行的 Android 应用,没有用于学习数据的后端连接;即便您使用自带 API Key 的云端模式,文本也只发送到您选择的服务商,而不是我们。
本地AI:为何设备端AI是更好的选择
DopaSpeak 使用 Google Gemma,一款在一次下载后直接在Android设备上运行的AI模型。这与ChatGPT或Google Translate等云AI服务有根本区别。
云AI与本地AI对比
- 云AI:您的文本 → 发送到服务器 → 服务器处理 → 返回响应。每次输入都会离开您的设备。
- 本地AI:您的文本 → 本地模型处理 → 响应保留在设备上。没有任何内容离开您的智能手机。
本地AI的优势
- 更强的隐私保护, 本地模型不向外部服务器传输数据
- 离线功能, 无需网络(模型下载后)
- 零延迟, 即时响应,无需等待服务器回应
- 无按次计费, 本地意味着无限制使用AI
- 独立性, 任何服务都无法关闭并影响您的使用
数据保护法规与 DopaSpeak
数据保护法规规定,个人数据只能在明确同意且出于合法目的的情况下才能处理。
DopaSpeak 对此要求给出了根本性的回答:我们根本不处理个人数据。没有数据处理,因此没有同意提示。没有Cookie,因此没有Cookie横幅。
DopaSpeak 在本地存储的内容
存储在您设备上的:
- 您的学习进度(已学的单词/文本)
- 已解码的材料(歌曲、文本)
- 应用设置和偏好
所有这些都保留在您的设备上,并受Android本地数据加密保护。
为何语言学习中的隐私保护尤为重要
语言学习是一项私密活动。您输入的文本、学习的歌曲、选择的语言,这些都揭示了很多关于您的信息:您的背景、兴趣、交流对象。
试想您正在学习阿拉伯语,用于与中东的商业往来。或者出于家庭原因学俄语。一旦落入错误之手,这些信息可能被用于画像。
在设备端本地模型模式下,DopaSpeak 让您所学的内容始终留在您手中。
中国的数据隐私法与DopaSpeak的意义
2021年11月,中国颁布《个人信息保护法》(PIPL),这是亚洲最严格的数据隐私法规,与GDPR相当。PIPL规定企业必须获得明确同意才能收集和处理个人数据,用户有权访问、更正和删除自己的数据。
然而,在AI数据安全问题升温的当下,许多中国用户对应用程序的数据收集感到不安。滴滴出行(2021)和字节跳动(2022)的数据泄露事件引发了公众对数据隐私的极度关注。云端存储的学习进度、搜索历史、个人文本,这些都可能成为风险。
DopaSpeak 提供了根本不同的选择:在设备端本地模型模式下,数据不会离开您的设备。学习进度存储在本地,设备端 AI 下载模型后无需联网即可运行,不做云端同步、不上传数据。您也可以选择自带 API Key 的云端模式,此时文本会发送到您选择的服务商。在本地模型模式下,您的学习是私密的,不是因为加密,而是因为从一开始就没有任何数据需要保护;因此在该模式下,PIPL 关注的数据收集问题对 DopaSpeak 并不适用。