Tutorial: Using R for Scalable Data Analytics

At the recent Strata conference in San Jose, several members of the Microsoft Data Science team presented the tutorial Using R for Scalable Data Analytics: Single Machines to Spark Clusters. The materials are all available online, including the presentation slides and hands-on R scripts. You can follow along with the materials at home, using the Data Science Virtual Machine for Linux, which provides all the necessary components like Spark and Microsoft R Server. (If you don’t already have an Azure account, you can get $200 credit with the Azure free trial.)

The tutorial covers many different techniques for training predictive models at scale, and deploying the trained models as predictive engines within production environments. Among the technologies you’ll use are Microsoft R Server running on Spark, the SparkR package, the sparklyr package and H20 (via the rsparkling package). It also touches on some non-Spark methods, like the bigmemory and ff packages for R (and various other packages that make use of them), and using the foreach package for coarse-grained parallel computations. You’ll also learn how to create prediction engines from these trained models using the mrsdeploy package.

Mrsdeploy

The tutorial also includes scripts for comparing the performance of these various techniques, both for training the predictive model:

Training

and for generating predictions from the trained model:

Scoring

(The above tests used 4 worker nodes and 1 edge node, all with with 16 cores and 112Gb of RAM.)

You can find the tutorial details, including slides and scripts, at the link below.

Strata + Hadoop World 2017, San Jose: Using R for scalable data analytics: From single machines to Hadoop Spark clusters

 

 

Source

3 thoughts on “Tutorial: Using R for Scalable Data Analytics”

  1. It’s awesome to go to see this web site and reading the views of
    all friends concerning this piece of writing, while I am also zealous of getting knowledge.

  2. เผย รับทำ seo youtube 2021 แบบไหน อันดับดีๆ
    ถ้าคุณคือนักธุรกิจออนไลน์
    ต้องรู้จักคำว่า SEO (Search Engine
    Optimization) หรือการปรับปรุงเว็บไซต์เพื่อให้ปรากฏในอันดับต้นๆ ของ Search
    Engine เพราะ seo trends 2021 คือสิ่งที่ช่วยเพิ่มปริมาณคนเยี่ยมชมเว็บไซต์ สร้างความประทับใจแก่กลุ่มเป้าหมาย
    เนื่องด้วยผลตอบแทนจากการทำ SEO แล้วอันดับดีขึ้นช่างดีต่อใจ SEO จึงเป็นกิจกรรมที่มีการแข่งขันอย่างเข้มข้น ไม่ใช่ทุกคนจะสมหวัง หลายเว็บไซต์ทำ SEO แต่ล้มเหลว เนื่องจากไม่สามารถแข่งขันกับเว็บไซต์ที่มีความเชี่ยวชาญเรื่อง SEO และเงินทุนที่มากกว่าได้
    การทำ seo คืออะไร ถ้าตอบแบบเข้าใจง่ายๆ คือ
    การผลักดันเว็บไซต์ตัวเองให้ติดหน้าแรกเวลาค้นหาบน google ด้วยkeywordที่ต้องการ ซึ่งจริงๆแล้ว คำนี้ย่อมาจากคำภาษาอังกฤษว่า Search engine optimization

  3. I’m now not certain the place you’re getting your info, however great topic.
    I must spend some time studying much more or understanding
    more. Thank you for wonderful info I was in search of this info for my
    mission.

Leave a Reply

Your email address will not be published. Required fields are marked *