[B! Hive][RCFile] wlbhiroのブックマーク

wlbhiro id:wlbhiro

HiveとRCFileに関するwlbhiroのブックマーク (6)

Cloudera Blog
wlbhiro 2017/05/22
Hive

TEXT

TextFile
リンク
Hive Training -- Motivations and Real World Use Cases
2. Overview Motivations Real world probl ems we faced at Facebook Why Hadoop and Hive Hadoop & Hive Deployment and Usage at Facebook System architecture Use cases of Hive in Facebook Hive open source development and supports More use cases outside of Facebook Open source development and release cycles More technical details 3. “Real World” Probl ems at Facebook – growth! Data, data and more data 200
wlbhiro 2016/11/15
Hive

facebook

RCFile

SEQUENCEFILE
リンク
Apache Hiveの今とこれから
分析指向データレイク実現の次の一手～Delta Lake、なにそれおいしいの？～（NTTデータテクノロジーカンファレンス 2020 発表資料）分析指向データレイク実現の次の一手～Delta Lake、なにそれおいしいの？～（NTTデータテクノロジーカンファレンス 2020 発表資料） 2020年10月16日（金） NTTデータシステム技術本部デジタル技術部梅森直人講演動画は、YouTubeチャンネル「NTT DATA Tech」にて公開中！ https://www.youtube.com/watch?v=NDb9nORBT_A "Apache Flink’s Exactly-Once Semantics (EOS) integration for writing to Apache Kafka has several pitfalls, due mostly to t
wlbhiro 2016/08/03
Hive

ORCFILE

RCFile
リンク
Blog - LINE ENGINEERING
As of October 1, 2023, LINE has been rebranded as LY Corporation. Visit the new blog of LY Corporation here: LY Corporation Tech Blog
wlbhiro 2016/07/31
Hive

RCFile

TextFile
リンク
TEXTFILE/SEQUENCEFILE/RCFILEのサイズ比較
基本的には以下のエントリーを自分なりに再試・咀嚼したものです。 HDFS and Hive storage - comparing file formats and compression methods - Adaltas Hiveテーブルを作成する際、SequenceFileはTextFileに比べてMapReduce時の処理効率は概ね良くなる傾向にありますが、様々なヘッダー情報が付与されるためファイルサイズ的には若干冗長になります。僕もHiveを触り始めてまだ１ヶ月ちょっとなので色々調べている中、RCFileという、HDFS上でHiveテーブルのように構造化されたデータを扱うのに適したデータ構造がある、という事を知ったので、それぞれ以下３種のデータフォーマットについてデータサイズの比較を行いました。 TEXTFILE SEQUENCEFILE RCFILE ◯前提条件今回試験に使
wlbhiro 2016/07/20
Hive

SEQUENCEFILE

RCFile

Hadoop

Compression

Compare
リンク
Hiveのパフォーマンスチューニングで試した７つのこと - Qiita
Spark, SQL on Hadoop etc. Advent Calendar 2014 - Qiita 10日目の記事です。とあるプロジェクトにて、パフォーマンスチューニングのために実施した７つのことをまとめました。この内容はCloudera World Tokyo 2014でお話しさせていただいた内容を再編したものです。登壇資料 - Hadoopで作る広告分析プラットフォーム登壇の様子 - 国内最大級のHadoop関連カンファレンスに登壇してきました！ 1.YARNが利用可能なリソースの変更 YARNではMR1と異なりスロットではなくコンテナという概念でリソースが管理されます。以下のパラメータでノードマネージャがコンテナに利用可能なメモリ量、CPU数を変更しました。 yarn.nodemanager.resource.memory-mb yarn.nodemanager.
wlbhiro 2016/07/19
Hive

Hadoop

type

Avro

SEQUENCEFILE

RCFile

Parquet

YARN
リンク
1

お知らせ

もっと読む

公式Twitter

@HatenaBookmark
リリース、障害情報などのサービスのお知らせ
@hatebu
最新の人気エントリーの配信

キーボードショートカット一覧

j次のブックマーク

k前のブックマーク

lあとで読む

eコメント一覧を開く

oページを開く

設定を変更しましたx