並び順

ブックマーク数

期間指定

  • から
  • まで

1 - 17 件 / 17件

新着順 人気順

apache iceberg java githubの検索結果1 - 17 件 / 17件

  • GitHub - modelcontextprotocol/servers: Model Context Protocol Servers

    Official integrations are maintained by companies building production ready MCP servers for their platforms. 21st.dev Magic - Create crafted UI components inspired by the best 21st.dev design engineers. 2slides - An MCP server that provides tools to convert content into slides/PPT/presentation or generate slides/PPT/presentation with user intention. ActionKit by Paragon - Connect to 130+ SaaS inte

      GitHub - modelcontextprotocol/servers: Model Context Protocol Servers
    • アプリケーションアーキテクチャをいい感じに検証し続けたい話 - CADDi Tech Blog

      こんにちは、Drawer Growthグループ ソフトウェアエンジニアの内田(id:usadamasa, @usadamasa)です。弊社ではApache Icebergの活用*1とともに、一部のアプリケーションにJavaを導入しています。今回は、システムアーキテクチャから一段レイヤを下げてアプリケーションレベルのお話しをしたいと思います。 アプリケーションアーキテクチャの設計と運用課題 アプリケーション開発において、私たちエンジニアは通常、パッケージ構成やレイヤの依存関係、ロギングなどの観点からアーキテクチャを設計します。 しかし、実装との不整合やチーム内での共通認識が不十分なまま進むと、品質課題として潜在化し、やがて本番障害や開発者の疲弊といった形で問題に発展します。また、DevinやClineなどのAIエージェントに適切に実装してもらうにはプロンプトやドキュメントで設計を伝える必要が

        アプリケーションアーキテクチャをいい感じに検証し続けたい話 - CADDi Tech Blog
      • キャディでの Apache Iceberg 活用事例 - CADDi Tech Blog

        こんにちは。Drawer Growth グループの江良です。 キャディが「製造業 AI データプラットフォーム」の構想を打ち出してから半年ほどが経ちました。 caddi.com このコンセプトの実現にあたっては、「AI」の部分だけでなく、「データ」の部分を支える仕組みづくりも重要になってきます。今回は、私が携わっているプロジェクトで導入した Apache Iceberg とその使いどころについて紹介したいと思います。 製造業におけるデータ活用の難しさ 本題に入る前に、まずは背景について少し補足します。 (Iceberg の話だけを読みたい人は「採用したアーキテクチャ」のところまでスキップしてください。) モノづくり産業における会社には多種多様なデータが存在する 製造業の世界で登場するデータにはさまざまなものがあります。 詳しくは キャディ、製造業AIデータプラットフォームとしての、第二章。

          キャディでの Apache Iceberg 活用事例 - CADDi Tech Blog
        • Lance / LanceDBとは何か - Bering Note – formerly 流沙河鎮

          マルチモーダル AI 向けのデータフォーマット Lance と、その上に構築されたデータベース LanceDB についてまとめます。AI/ML や検索に関わる要件を Parquet や Avro、それらの上に成り立つ Iceberg で扱うことに限界を感じていたところ、Lance がそうした要件にフィットすることに気づき、調べた内容を整理しました。Lance は Iceberg を置き換えるものとは限らず、カタログの共有や将来的なファイルレベルの統合など、組み合わせて使う道も開かれています。 はじめに 概要 Lance とは LanceDB とは SDK と対応エンジン 特徴 アーキテクチャ ファイルフォーマット エンコーディングとバージョン体系 圧縮とランダムアクセスの両立: structural encoding semi-structural transformations 参考論文

            Lance / LanceDBとは何か - Bering Note – formerly 流沙河鎮
          • 氷山を穿つ - Apache Icebergに大量データを投入するTopic - - CADDi Tech Blog

            こんにちは、柴犬がかわいい。Tech本部の前多です。 先日、弊社でApache IcebergとTrinoによる活用事例についての記事を上げました。 caddi.tech 記事では、Icebergへのデータ投入について次の記述がありました。 ユーザがアップロードしたCSVファイルをパースしてIcebergに保存する 図面の解析結果を一定間隔のバッチで受け取りIcebergに保存する 実際のところ、ファイルからIcebergへのデータ投入はサイズによっては困難なことがありました。 今回はIcebergへのデータ投入に関するTopicをお伝えします。 データ投入で発生した課題 私たちは、クエリエンジンとしてTrinoを採用しています。 データ投入の経路はCSVファイルしかないので、CSVファイルを解析して一行ごとにTrinoのInsert文を発行すれば十分だろうと考えていました。 また、Tri

              氷山を穿つ - Apache Icebergに大量データを投入するTopic - - CADDi Tech Blog
            • AWS re:Invent 2022で発表された新サービス/アップデートまとめ - Qiita

              Deleted articles cannot be recovered. Draft of this article would be also deleted. Are you sure you want to delete this article? AWS re:Invent 2022の会期中に発表された新サービス/アップデートのまとめです。 今年も、後から出来るだけ素早く簡単に振り返ることができるようにまとめました! 凡例 (無印) 新サービス (Update) 既存サービスのアップデート (APN) パートナー制度に関連したリリース/アップデート 日時は米国時間で表記します。 11/28 (月) Amazon EC2 C7gn instances (Preview) 前世代のC6gnインスタンスと比較して、最大200Gbpsのネットワーク帯域幅と、最大50%高いパケット処理性能

                AWS re:Invent 2022で発表された新サービス/アップデートまとめ - Qiita
              • 達人出版会

                探検! Python Flask Robert Picard, 濱野 司(訳) BareMetalで遊ぶ Raspberry Pi 西永俊文 なるほどUnixプロセス ― Rubyで学ぶUnixの基礎 Jesse Storimer, 島田浩二(翻訳), 角谷信太郎(翻訳) 知る、読む、使う! オープンソースライセンス 可知豊 きつねさんでもわかるLLVM販売終了 柏木餅子, 風薬 半導体の酸化機構と酸化膜 公益社団法人 応用物理学会 半導体分野将来基金委員会 ステップアップ Pythonプログラミングの教室 池田 瑞穂 アプリケーション開発の基礎 飯尾 淳 ゼロからのTCP/IPプロトコルスタック自作入門 山本雅也 Kubernetesの教科書 Nigel Poulton(著), 窪田優(訳) 脅威ハンティング Nadhem AlFardan(著), 徳正保彦, 東結香, 田中啓介, 山重

                  達人出版会
                • TrinoとIcebergでログ基盤の構築 | さくらのナレッジ

                  はじめに 2023年10月5日(木)にTrino / Presto Conference Tokyo 2023 (Online)が開催されました。本記事はイベントにて発表した内容をご紹介します。 社内の監視サーバについて さくらインターネットでは現在社内の各チームでPrometheus, Elastic Stack, Lokiなどの監視基盤を個別に運用しています。この状態では運用負荷が大きいためSRE室でログ基盤を提供することにより、運用の手間を減らすことや運用レベルを底上げしてコスト削減ができるのではないかと検討しています。既存のOSSでの運用も行ってみたものの、マルチテナント提供・ライセンス体系の問題など課題があったことからTrinoとIcebergでの開発を始めました。 Icebergとは Icebergはビッグデータ・データレイクを構築するためのストレージフォーマットです。データの

                    TrinoとIcebergでログ基盤の構築 | さくらのナレッジ
                  • Tech Solvency: The Story So Far: CVE-2021-44228 (Log4Shell log4j vulnerability).

                    Log4Shell log4j vulnerability (CVE-2021-44228 / CVE-2021-45046) - cheat-sheet reference guide Last updated: $Date: 2022/02/08 23:26:16 $ UTC - best effort, validate all for your environment/model before use, unofficial sources may be wrong by @TychoTithonus (Royce Williams), standing on the shoulders of many giants Send updates or suggestions (please include category / context / public (or support

                    • DuckDB 1.4.0リリース、今後のLTSリリースは1つおきに | gihyo.jp

                      DuckDB Foundationは2025年9月16日、オープンソースの組み込み型データベースDuckDBの新バージョン1.4.0(コードネーム“⁠Andium⁠”[1])をリリースした。 Announcing DuckDB 1.4.0 -DuckDB 📈 DuckDB 1.4.0 is out! This is our first LTS release which comes with *one year of community support*. It also supports database encryption, the MERGE SQL statement and Iceberg writes. 🔍 For more details, read the announcement blog post athttps://t.co/ncBre0vbqW pic.twi

                        DuckDB 1.4.0リリース、今後のLTSリリースは1つおきに | gihyo.jp
                      • Athena で圧縮を使用する - Amazon Athena

                        Athena は、複数の圧縮形式を使用するテーブルからの読み込みなど、データの読み書きのためのさまざまな圧縮形式をサポートしています。例えば、一部の Parquet ファイルが Snappy で圧縮されており、他の Parquet ファイルは GZIP で圧縮されているといった、Parquet ファイル形式を使用するテーブル内のデータも、Athena は正常に読み込むことができます。同様なことが ORC、テキストファイル、および JSON のストレージ形式に対しても当てはまります。 BZIP2 – Burrows-Wheeler アルゴリズムを使用する形式。 DEFLATE – LZSS および Huffman コーディングをベースにした圧縮アルゴリズム。DEFLATE が適しているのは Avro ファイル形式のみです。 GZIP – DEFLATE をベースにした圧縮アルゴリズム。Ath

                        • Apache Iceberg の table を near real time で更新する

                          Apache Iceberg の table を near real time に、つまり高頻度で更新するということをやってみた。 Apache Iceberg とは#Apache Iceberg (以下 Iceberg) は分散ファイルシステムやクラウドストレージ上の table format であり、Apache Hudi や Delta Lake と並んで data lake や lakehouse architecture で用いられる。 特徴的なのは table とデータ実体 (Parquet, Avro など) の間に metadata file, manifest list, manifest file の抽象的なレイヤーがあり、ファイル単位で table の状態を track できること。 これにより強い isolation level、パフォーマンス、schema evo

                            Apache Iceberg の table を near real time で更新する
                          • OTFSG Tokyo Meetup #2 で「Kafka ConnectのIceberg Sink Connector」をテーマに発表してきた - MicroAd Developers Blog

                            マイクロアドの京都研究所からリモートで働いているインフラ開発ユニットの永富 id:yassan0627 です。 3/1に開催されたOpen Table Format Study GroupのMeetupの第2回目にて、「Kafka ConnectのIceberg Sink Connector」をテーマに話してきました。 今回は、その紹介です。 otfsg-tokyo.connpass.com Open Table Format Study Group(OTFSG) について 私の発表について Kafka Connectとは Iceberg Sink Connectorとは お試し環境について 私以外の発表について 最後に Open Table Format Study Group(OTFSG) について Open Table Format Study Groupは、以下を目的とする勉強会で

                              OTFSG Tokyo Meetup #2 で「Kafka ConnectのIceberg Sink Connector」をテーマに発表してきた - MicroAd Developers Blog
                            • Icebergテーブルの内部構造について - やっさんメモ

                              この記事は MicroAd Advent Calendar 2023 と Distributed computing (Apache Spark, Hadoop, Kafka, ...) Advent Calendar 2023 の1日目の記事です。 qiita.com qiita.com 今年もアドカレの季節がやってきました🎄 今回は、ここ数年でデータ界隈で盛り上がっているOpen Table FormatのIcebergテーブルについて書いていきます。 Hiveテーブルとの比較とか、Icebergテーブルの特徴(Time Travel や Rollback、Hidden Partitioning、Full Schema Evolution等)については、あっちこっちで大分こすられてます。 そこで、Icebergテーブルの特徴がなぜ実現できているのかについて知るために、内部構造がどうな

                                Icebergテーブルの内部構造について - やっさんメモ
                              • Dive deep into AWS Glue 4.0 for Apache Spark | Amazon Web Services

                                AWS Big Data Blog Dive deep into AWS Glue 4.0 for Apache Spark Jul 2023: This post was reviewed and updated with Glue 4.0 support in AWS Glue Studio notebook and interactive sessions. Deriving insight from data is hard. It’s even harder when your organization is dealing with silos that impede data access across different data stores. Seamless data integration is a key requirement in a modern data

                                  Dive deep into AWS Glue 4.0 for Apache Spark | Amazon Web Services
                                • Cloud Native CI/CD with Tekton and ArgoCD on AWS | Amazon Web Services

                                  Containers Cloud Native CI/CD with Tekton and ArgoCD on AWS Introduction With the ongoing popularity and adoption of container orchestrators such as Kubernetes, more and more cloud-native applications are built on top of it. Besides business applications, companies are migrating their infrastructure-related components such as CI/CD systems as well. But are those systems ready for such modern platf

                                    Cloud Native CI/CD with Tekton and ArgoCD on AWS | Amazon Web Services
                                  • Icebergで時間に基づくパーティションを設定する前に読む記事 - Bering Note – formerly 流沙河鎮

                                    TL;DR パーティショニングとは Hiveテーブルにおけるパーティション構造 IcebergのTransformとHidden Partitioning Transformの仕組み 時間に関わるカラムへのTransformをどのように指定するべきか なぜ複数のTransformを指定する必要がないのか Icebergメタデータ構造とパーティション管理 マニフェストリストとマニフェストファイルの役割 階層的な時間単位の自然な扱い まとめ Apache Icebergのパーティショニングは、従来のHiveテーブルとは大きく異なる設計思想を持っています。この記事では、Icebergの「Transform」と「Hidden Partitioning」の仕組みを詳しく解説します。 その上で、時間に関わるカラム(date, timestamp, timestamptz, timestamp_ns,

                                      Icebergで時間に基づくパーティションを設定する前に読む記事 - Bering Note – formerly 流沙河鎮
                                    1