案例背景

天弘基金作为国内总规模最大的公募基金,阿里云MaxCompute为我们构建了企业级一站式大数据解决方案。MaxCompute对于海量数据的存储、运维、计算能力强大且安全稳定,MaxCompute服务将原本需要清算8小时的用户交易数据缩短至清算1个半小时,同时减少了本地服务器部署压力,在显著提升我们工作效率的同时减少了大量开发成本和人力成本,使我们能更专注于业务发展,为用户提供高品质、高价值的金融服务。

业务痛点

随着余额宝用户数持续呈指数级增长,数据量也成倍增长。在这种情况之下,已经无法通过简单的hadoop集群进行数据的管理工作,而业务端面临需要通过数据了解用户、分析行为进而对业务决策和用户行为进行精准预测。基于这些业务的需求驱动需要一个大数据平台来承载,我们在对稳定性、成本、自身能力和复杂度等进行综合考量后,决定采用当前最流行和最成熟的云平台·阿里云MaxCompute。

搭建大数据平台从技术指标的角度是数据存储和数据计算两大目标,而从各个业务环节的角度看是数据采集、数据清洗、在线/离线分析与预测、实时/非实时查询。而业务目标是为了能够快速响应业务需求,能够为业务分析提供稳定的开发和建模平台,为业务提供逻辑清晰和灵活便捷的可视化平台。从而实现从数据支持业务到数据驱动业务的逐步升级。

解决方案

解决方案架构图
  • 采集层:采集层对接了我们几乎所有的业务,采集数据的频率有实时的、分钟级、小时 级、日级、月级,支持不同的采集频率,而且这些都是灵活可配置的。将采集的数据 通过企业级的数据交换平台进行存储和交换,该平台使用OSS 实现。通过OSS 可 以实现数据的中转、分发和备份存储。
  • 整合层:在MaxCompute 整个整合层包含了五大区:缓冲区、ODS区、整合区、主数据和汇总区。不同的区域为了实现不同的功能,缓冲区是为了在正式进入数仓应用数 据模块之前进行数据质检,满足质检后方可进行真正的加工处理,避免因为数据错 误污染整个数仓的数据;ODS 区是为了保留源系统格式的数据模块,一方面能够在有问题时追根溯源,另一方面能够满足部分业务的需要;整合区是数据仓库的核心区域,通过主题建模的方式进行数据的模型化处理,使得数据的解释口径具有统一性; 主数据则是与业务结合比较紧密的主题数据,这样更方便业务方的使用;汇总区则是提前将需要预加工统计的数据进行统计计算,避免多次开发计算带来的时间成本、开发成本和计算成本等。
  • 应用层:应用层主要是通过监控、管理看板、报表等可视化系统给业务提供直观的数据呈现,从而为业务的决策提供更加有力的数据支撑。在应用层通过RDS、ADS、HBase等不同的产品满足了不同的需求。

    对于数据仓库来说是一个比较复杂的系统,需要很多配套的系统辅助才能做好这样的项目。而其中很多系统在MaxCompute、DataWorks 中都已经产品化,大大的简化了大数据平台的搭建和运维,提供了一站式的解决方案,而且通过阿里云 MaxCompute、Dataworks 能够实现敏捷开发、快速响应、轻量化运维、低成本地实现大数据平台架构。其中包括最核心的调度系统、权限管理、元数据管控、数据安全保护伞等等一系列功能。而在使用中,数据分析师能够快速上手完成数据的加工和分析。

上云价值

收益王者产品帮助广大用户追踪头部用户的交易行为,使用用户自身数据来影响用户心智,满足了用户的窥私欲、攀比欲。该产品为用户提供了投顾化的数据服务, 为公司提升了用户粘性及交易转化,在2018 年实现销量数亿元。在开发过程中, MaxCompute 帮助我们快速、精准地处理海量用户交易数据,为该产品数据的准确性、稳定性、及时性提供了有力的保障。

我们根据用户自身属性、交易行为、资产属性以及与他类似的用户的产品关注 和交易行为,预测每位用户当前最感兴趣的基金。产品AI 推荐与传统的仅从市场 出发的产品推荐不同,我们从用户的角度,根据用户的行为数据,做出千人千面的产品推荐,提升了用户体验,并提升了交易转化率。在特征加工、模型开发、预测 结果投入使用的过程中,Dataworks为我们提供了整套技术架构,包括算力强大的 MaxCompute、组件丰富的PAI 机器学习平台以及ADS、RDS 等产品,满足了我们各方各面的需求。

相关产品

  • 大数据计算服务 · MaxCompute

    MaxCompute(原ODPS)是一项大数据计算服务,它能提供快速、完全托管的PB级数据仓库解决方案,使您可以经济并高效的分析处理海量数据。

    更多关于阿里云MaxCompute的介绍,参见MaxCompute产品详情页

  • 机器学习PAI

    阿里云机器学习平台PAI(Platform of Artificial Intelligence),为传统机器学习和深度学习提供了从数据处理、模型训练、服务部署到预测的一站式服务。

    更多关于机器学习PAI的介绍,参见机器学习PAI产品详情页

  • 云数据库RDS MySQL版

    MySQL 是全球最受欢迎的开源数据库之一,作为开源软件组合 LAMP(Linux + Apache + MySQL + Perl/PHP/Python)中的重要一环,广泛应用于各类应用场景。

    更多关于云数据库RDS MySQL版的介绍,参见云数据库RDS MySQL版产品详情页

  • DataWorks

    DataWorks是一个提供了大数据OS能力、并以all in one box的方式提供专业高效、安全可靠的一站式大数据智能云研发平台。 同时能满足用户对数据治理、质量管理需求,赋予用户对外提供数据服务的能力。

    更多关于阿里云DataWorks的介绍,参见DataWorks 产品详情页

  • 云数据库 HBase 版

    面向大数据领域的一站式NoSQL服务,100%兼容开源HBase并深度扩展,支持海量数据下的实时存储、高并发吞吐、轻SQL分析、全文检索、时序时空查询等能力,是风控、推荐、广告、物联网、车联网、Feeds流、数据大屏等场景首选数据库,是为淘宝、支付宝、菜鸟等众多阿里核心业务提供关键支撑的数据库。

    更多关于云数据库 HBase 版的介绍,参见云数据库 HBase 版产品详情页

  • 对象存储OSS

    阿里云对象存储服务(Object Storage Service,简称 OSS),是阿里云提供的海量、安全、低成本、高可靠的云存储服务。其数据设计持久性不低于 99.9999999999%(12 个 9),服务设计可用性(或业务连续性)不低于 99.995%。

    更多关于对象存储OSS的介绍,参见对象存储OSS产品详情页