成本降低 90%,出海社交平台 Typing 基于 Databend 的大数据探

Typing(输入中科技)成立于 2022 年,是一家主要面向东南亚、拉美、中东等海外地区提供社交平台的出海企业。其社交平台类似于国内的 Soul、陌陌等,提供视频直播、语音聊天室、短视频、生活分享、文字聊天等社交功能,注册用户超百万,日活用户数十万。人们可以在平台内认识有趣的人,结交新朋友,还可以建立自己的社交社区。

Typing 业务场景特点

如今,社交平台已经成为生活中必不可少的一部分。人们在社交平台上交友、分享和交流信息,这些信息包含了丰富的用户行为和偏好数据。大数据技术使得这些海量的数据可以被有效地挖掘和分析,从而为社交平台的发展和用户体验,提供技术支撑和决策支持。

Typing 作为一家社交公司,数据的重要性不言而喻,通过数据可以挖掘出许多商业价值:

一,构建社交平台的用户画像。用户画像是基于用户的行为数据和个人信息建立的用户模型。Typing 通过分析用户的关注、好友关系、兴趣爱好等数据,可以对平台内用户进行准确的用户画像构建。通过用户画像,平台可以更好地理解用户的需求和行为倾向,从而为 Typing 的用户提供更加个性化和精准的服务和推荐,提升平台的用户体验度和满意度。

二,社交平台的内容推荐和个性化推送。Typing 整个社交平台的内容繁多复杂,包含音频、视频、文字、图片等多种形式,用户在其中找到自己感兴趣的内容和人往往比较困难。借助大数据分析技术,Typing 可以对用户的历史行为数据进行分析,了解用户的兴趣和偏好,从而为用户提供个性化的内容推荐和推送。通过个性化内容推送,Typing 社交平台可以提高用户的活跃度和粘性,同时也增加用户对平台的依赖和忠诚度。

三,社交平台的社交关系挖掘。作为社交平台,人与人之间的社交关系是 Typing 的核心所在,对社交关系的理解和分析可以帮助 Typing 更好地发现用户的兴趣和需求。借助大数据分析技术,Typing 可以分析用户的好友关系、互动行为等数据,发现用户之间的兴趣群体和社交网络,从而为用户提供更加精准和相关的社交推荐。同时,社交关系挖掘还可以为平台提供用户流失预测和用户关系维护等策略指导,提高用户的留存和活跃度。

Typing 面临的技术挑战

受限于创业公司的规模,Typing 整个研发团队只有 15 人左右,没有专门的大数据团队和 AI 算法推荐团队,但是公司对精细化运营有着强烈需求,这就需要对用户、对整个平台做到知根知底。如何基于数据得出有价值的分析和洞察变得不可或缺。为了实现这一目标,Typing 技术团队进行了很多摸索,先后接触过阿里云、火山引擎的大数据方案,但在 Typing 看来,这些方案从文档到接入都很复杂,时间和人力成本都比较高,对于一家创业公司而言很难落地。

Typing 也曾经试用过开源的 Clickhouse,但它需要有专门的数据开发人员做一些中间的数据清理 ETL 工作,由于缺乏这方面的人力最终也未能落地。

为什么选择 Databend?

在一次大会的开源活动中,Typing 技术团队负责人武云鹏接触到了 Databend,在经过一系列深入了解和交流后,他被 Databend 以下几个特点所深深吸引:

  • 存算分离架构:Databend 将存储与计算完全分离,用户可以根据应用程序的需要轻松扩展或者缩小。同时,Databend 完全面向对象存储设计,突破了传统数据库磁盘容量的束缚;

  • 高性能查询:Databend 先进的架构和矢量化查询引擎,不仅实现了海量数据的即时分析,更将延迟缩短到亚秒级。同时利用数据级并行( Vectorized Query Execution )和指令级并行( SIMD )技术,提供性能卓越的数据分析。在TPC-H标准下,Databend在导入数据,cold run,hot run三个维度上比国外主流新一代存算一体云原生数据库整体快 1.3 倍;相比传统存算一体数据库有 2-3 倍的速度提升;

  • 与主流数据生态和工具无缝对接:Databend Cloud 与主流数据技术和工具无缝对接,提供 Java、Go、Python、Node.js、Rust 等语言 SDK,支持与 Kafka、DBT、FlinkCDC、Airbyte、Data X、Devezium 等工具对接,解决了 Typing 原有技术栈的兼容问题,满足了在数据转换、商业智能、Ad-Hoc 分析和数据应用方面的所有需求,可以帮助用户快速挖掘数据的潜在价值;

  • 低成本:Databend Cloud 经济、智能的计算集群,搭配高度压缩、性能优化的对象存储,可以将成本降低高达 90%,像 Typing 这样的创业公司进行数据处理不必再花费巨资;

  • 使用方便:Databend Cloud 提供一站式 SaaS 服务,通过数据管道和任务管理,可以让数据导入变得更为简单,让用户免运维,开箱即用。同时,Databend 没有要构建的索引,不需要手动调整,不需要手动计算分区或分片数据,所有这些都在数据加载到表中时完成。

部署方案

Databend 的各项特性刚好契合了 Typing 对于大数据平台的各项需求,于是 Typing 选择了 Databend 数据库作为主要的大数据分析工具。经过一系列规划、准备、兼容性评估等工作,成功将大数据计算业务迁移到 Databend Cloud 上。 

 目前,Typing 的数据源主要来自 AWS Aurora 数据库,开发人员每天定时以 T+1 的方式进行数据同步。首先用 databend-py SDK 将 Aurora 数据库中的几十张表导出到 S3 中,然后再通过 Databend 将 S3 里的数据直接导入 Databend Cloud。得益于 Databend 所坚持的开源理念和对 Superset 的开源贡献,Databend 可以非常轻松地接入 Superset 开源数据看板工具。经过 Databend Cloud 计算后的数据再传到 Superset 中就可以进行数据可视化展现了。

在这个场景中,Databend 主要用途是承载运营数据看板。Typing 每天早上 8 点开始同步,数据量大约 2-3TB,10 点上班前就可以完成数据导入和计算。Typing 的技术人员上班后就可以在 Superset 中,做一些面向运营和产品的可视化数据看板。

此外,Databend 在 Typing 还有另一个用途,利用数据库中产生的用户行为历史数据(如消费记录、语音房、送礼物等数据),在 Databend Cloud 中进行全量用户计算,计算出用户分群标签,然后导入业务服务器,支撑业务应用开发对用户做出区分,进行更多的个性化推送。

项目收益

从去年 11 月部署完成到现在已经过去了半年时间,Databend Cloud 非常好地解决了 Typing 大数据分析的各种挑战,不论是查询速度、结果的准确性还是成本,都超出了 Typing 的预期。

  • 迁移到 Databend Cloud 后,在查询速度更快的基础上,Typing 的数据成本降低了 90%,目前成本中最高的部分是从 AWS Aurora 同步数据到 Databend Cloud 的消费,Typing 也正在尝试与 Databend 一起探索通过更换同步机制减小这部分成本;

  • Typing 的运营团队经常通过写 SQL,来定一些指标查看数据看板。由于 Databend 提供了统一的 SQL 接口,符合产品和研发原有数据库使用习惯,节省了适应成本。运营团队反馈新的数据看板上手非常简单,无论写什么都能很快给出结果,整个过程非常顺滑稳定;

  • 在服务过程中,Databend 官方提供了专属工程师服务,紧急问题天级或小时级就可以反馈修复。对于 Typing 而言,可以节省出专门的数据开发人力,将 Databend 工程师作为数据团队的一部分,这在以往一些云大厂服务中是完全可不想象的。

未来探索

目前,Typing 正在开启对 Databend 的新一轮探索,对 Databend 的信任也让 Typing 想将其拓展到更广的用途中。未来,Typing 计划将业务服务器的埋点数据也同步到 Databend Cloud 中。由于埋点数据包含了更多的用户行为,相比数据库数据而言,这些数据对业务决策更有价值,这部分数据将用来支撑一些时效性更强的逻辑业务。而服务器的埋点数据更具时效性,大概每 15 分钟同步一次,需要进行近实时同步。Databend 经过成本和时效性等方面考量,提供了一种增量同步方案,最小可以达到小时级,

在与 Typing 的整个合作过程中,Databend 不仅帮助 Typing 解决了现有的许多技术难题,还秉承着开放合作的理念与 Typing 一起进行更多场景的探索,为社交平台业务的发展提供可靠的数据支持。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hqwc.cn/news/686031.html

如若内容造成侵权/违法违规/事实不符,请联系编程知识网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

多模态模型Mini-Gemini:代码模型数据均开源,MiniCPM小钢炮2.0全家桶四连发,可以在Android 手机端上运行的大模型,效果还不错

多模态模型Mini-Gemini:代码模型数据均开源,MiniCPM小钢炮2.0全家桶四连发,可以在Android 手机端上运行的大模型,效果还不错。 多模态模型Mini-Gemini:代码模型数据均开源 香港中文大学终身教授贾佳亚团队提出多模态模…

文心一言 VS 讯飞星火 VS chatgpt (255)-- 算法导论18.3 1题

一、请说明依次从图18-8(f)中删除C、P和V后的结果。如果要写代码,请用go语言。 文心一言: 首先,让我们明确一点:由于您没有提供具体的图18-8(f)的内容,我只能假设它是一个数据结构(可能是图、树或列表等&…

【JVM】了解JVM规范中的虚拟机结构

目录 JVM规范的主要内容 1)字节码指令集(相当于中央处理器CPU) JVM指令分类 2)Class文件的格式 3)数据类型和值 4)运行时数据区 5)栈帧 6)特殊方法 7)类库 JVM规范的主要内容 1&#…

三层交换机静态路由连通实验

静态路由是一种手动配置路由表的方式,网络管理员需要手动指定网络中的每一个路由器下一跳路由器的地址,以及到达目的网络的最短路径。静态路由的路由表不会自动更新,如果网络拓扑发生了变化,管理员需要手动更改路由表。 实验拓扑图…

【Web】2023浙江大学生省赛初赛 secObj 题解

目录 step 0 step 1 step 2 step 3 题目本身是不难,简单复健一下 step 0 pom依赖就是spring 反序列化入口在./admin/user/readObj 输入流做了黑名单的过滤,TemplatesImpl不能直接打 可以jackson打SignedObject二次反序列化绕过 具体原理看下面这…

从头理解transformer,注意力机制(上)

深入理解注意力机制和Transformer架构,及其在NLP和其他领域的突破。 要想理解transformer,先从编码器解码器结构开始理解 基于transformer发展起来的llm 右边:只有解码器,强项是生成内容 左边:只有编码器&#xff0…

RS2255XN功能和参数介绍及PDF资料

RS2255XN是一款由Runic(润石)公司生产的模拟开关。以下是关于RS2255XN的一些技术参数和特点: 封装:MSOP-10 电源电压范围:2.5V至5.5V 工作温度范围:-40C至125C 类型:模拟开关 品牌:R…

正点原子i.MX 93开发板,双核A55+M33+NPU,双路RS485FDCAN千兆网,异核/AI/工业开发!

正点原子i.MX 93开发板新品上市!双核A55M33NPU,双路RS485&FDCAN&千兆网,异核/AI/工业开发! NXP的i.MX系列是一系列面向多媒体和工业应用的ARM架构微处理器。从i.MX6U到i.MX93,这一系列经历了显著的发展&#x…

RH850F1KM Part1 创建一个新工程

1、选择File->New ECU Project.# 2、填写工程名和工程文件路径,点击Next 3、点击Next 4、点击Finish 5、报错:# 6、步骤5报错原因: RH850F1KM 搭建MCAL配置环境中复制到BSWMD文件夹下的文件过多,除包含当前芯片型号外&#…

代码随想录训练营Day28:贪心算法06

1.738单调递增的数字 贪心策略&#xff1a;如果strNum[i]<strNum[i-1]那么strNum[i] 9,strNum[i-1]--;//比如87对应的最大的单调递增的就是79. 具体实现&#xff1a; 对于遇到小于的情况&#xff1a;如果strNum[i]<strNum[i-1]那么strNum[i] 9,strNum[i-1]--;遍历顺…

【线性代数】英语版听课笔记

线性代数 - 北京航天航空大学&#xff08;英文版&#xff09;_哔哩哔哩_bilibili 39.concept of vector space in this lecture we will studyvector space&#xff0c; the concept of basis dimension and coordinates 向量空间的维数&#xff1a;向量空间的基底所含向量的…

VM虚假机联网(无代码,超简单)NAT模式

1、左边顶上编辑里面最下面找到虚拟网络编辑器2.启用管理员特权3.重新创建一个NAT模式的网络&#xff08;名称随便一个&#xff09; 4.打开这两个设置里面的东西进行拍照并记住IP区间和网关&#xff0c;等下要用&#xff1b; 5.打开虚拟机&#xff0c;右上角&#xff0c;下标点…