[B! hadoop][HDFS] wasaiのブックマーク

副業Cloud｜自由なビジネスを求めて

副業市場の急成長に伴い、多くの人々が新たな収益源を求めて副業やネットビジネスに参入しています。しかし、その中には不透明な情報や誤解を招く宣伝、リスクの高い案件も少なくありません。当ブログでは、こうした環境の中で正しい選択を行うための知識と検証を提供することを目的としています。ネット上の副業を詳細に検証し、信頼できる情報を整理・提供することで、みなさまが安全かつ効果的に副業に取り組めるよう支援します。

wasai 2012/10/03

リンク

目指せHadoopエンジニア-管理者・DBエンジニア編-

EnterpriseZine（エンタープライズジン）編集部では、情報システム担当、セキュリティ担当の方々向けに、EnterpriseZine Day、Security Online Day、DataTechという、3つのイベントを開催しております。それぞれ編集部独自の切り口で、業界トレンドや最新事例を網羅。最新の動向を知ることができる場として、好評を得ています。

wasai 2012/07/25

リンク

MapR(GreenPlumHD)の中身説明会参加

MapR(GreenPlumHD)の中身説明会に参加しました。「HadoopのC++実装らしい。」程度の予備知識しかない状態で参加したので、知らないことが多くて面白かったです。思ったことなど MapRはEMCと提携していたのか。知らなかった。 MapR-FSは普通のファイルシステムは経由せずに、ブロックデバイスをそのまま使っている。へー。ビルトイン圧縮は拡張子で判断して圧縮の有効／無効を切り替えているのが面白い。jarやpptxをはじめ、最近はほとんど実態はzipな気がするので、ちゃんとフォーマットを見ないとダメでしょう。全然詳しくないけど、普通最初の4バイトくらいで判別できるんじゃないの？実機デモのサクサク感がすごかった！WebUI※1とNFSマウントしたときの操作※2。「すげー速いよ。品質いいよ。」とは言っているけど、デモがサクサクなの以外は言っているだけだった。NTTデータ

wasai 2012/01/20

あとで読む

リンク

HDFSのファイルオペレーション各種 #hadoopAC11jp - たごもりすメモ

この記事は hadoopアドベントカレンダーの14日目の記事です。みなさんHDFS使ってますか。使ってますよね。最近はgluster fsなどの選択肢も出てきていますが、まだ第一の選択肢はHDFSという人がほとんどだと思います。で、HDFSのファイル操作をどうしようか悩みますよね。めんどくさいです。いくつかあるので比較してみましょう。 hadoop fsコマンドみんな大好きhadoop fs。日に100回くらいは叩きますね。基本的にはみんなこれを使うでしょうか。ただし以下いくつかの「たるいなー」という点があります。 Hadoopがインストール・設定されていないと動かないあたりまえなんですけど意外にめんどくさいですね。 Hadoopの処理対象となるファイルはもちろんHadoopクラスタ「以外」のサーバから出てくるわけで、そこからも直接ファイルをHDFSに突っ込みたいなーというのは割

wasai 2011/12/15

あとで読んでおく

リンク

Hadoopの可用性について（私訳） - developer’s delight

この記事はClouderaのBlogの記事”Hadoop Availability | Apache Hadoop for the Enterprise | Cloudera”の私的翻訳です。Hadoopの可用性については興味のある方も多いと思いますので、読むついでに訳してみました。勢いで訳したので質に関しては責任を持てませんのでよろしくお願いします。間違いなどがありましたらご指摘いただければ助かります。(id:kkawamura)Apache Hadoopのメーリングリストでよくある質問は、可用性を保つためにどうするか？というものです。この記事では、Hadoopのコンテキストでの可用性について見ていき、進行中の開発の方向性を示します。背景Hadoopの可用性を議論するとき、人はよくNameNodeがHDFSにおいて単一故障点であるため、NameNodeから話をはじめます。そしてHadoo

wasai 2011/02/14

良い訳ですので、あとで読み直しておこう

リンク

Hadoop(libhdfs)各バージョンとscribeの微妙な関係 - たごもりすメモ

調べた内容を忘れそうなのでメモ。Hadoopのリリース元およびバージョンごとにあれこれとscribeから使えるかどうかの制約があるので、書き出してみる。 scribeから使えるHadoopのバージョン Apacheリリース版 stable 0.20.2：ダメ scribeをApacheリリース版の 0.20.2 (以下 0.20.2) の libhdfs/hdfs.h を参照しつつビルドしようとすると、以下のようなエラーが出る。 HdfsFile.cpp: In member function ‘void* HdfsFile::connectToPath(const char*)’: HdfsFile.cpp:227: error: ‘hdfsConnectNewInstance’ was not declared in this scope HdfsFile.cpp:255: error

wasai 2011/01/08

こちらもあとで読んでおこう

リンク

scribedのセットアップ手順ひと通り(hdfs書き込み有効版) - たごもりすメモ

ログの収集をscribeでやりたいぜ！と思ったがREADMEに書いてある通りにやろうとしてもうまくいかず七転八倒し、しかもその上hdfsに書き込もうとしたらHadoopまわりで更に苦悶の日々を送るという苦難の道のりをようやく完走したので、それについて書いてみる。正直に言ってかなりテキトーにやっつけたが、動くバイナリができているから多分大丈夫だろう。細かい問題については、知らん。 (1/24追記 CentOS 5.5 でもビルドできたので何箇所かに追記しました) なお今回は Fedora 13 で実行しました。(01/24追記)CentOS 5 だとboostが古いので、そこを自分でどうにかする必要がある(素のCentOS 5.5だとscribeのビルド時にboostのバージョン 1.36 以降を要求されて失敗する)。Ubuntu や Debian だと割といけそうな話は多いが、試してな

wasai 2011/01/08

あとで読んでおこう

リンク

そろそろHadoopについてひとこと言っておくか - nokunoの日記

もうこの手の話題は出尽くした感がありますが、最近Hadoopについて考えることが多いので、エントリにしてみます。なお、ここではベーシックなMapReduce+HDFSのことをHadoopと呼ぶことにします。 HadoopとはHadoopとは言わずと知れたGoogleのMapReduce/GFSのオープンソースのクローンです。MapReduceではプログラマはMapとReduceという2つの関数を書くだけで、並列分散処理をすることができます。これは(1) データを実際に持つマシンにプログラムを配布する (2) MapとReduceをつなぐShuffleフェーズでキーをグループ化してソートする、(3) 障害時のフェールオーバーやレプリケーション、といった処理をフレームワーク側が受け持つことによって、プログラマ側の負担を減らすものです。GFSに対応するHDFSにはファイルをクラスタに分散して保存