ニュースイミー

QA・テスト

Frontier and Center: 誰が評価ツールを評価するのか?

cloud.google.com

AIエージェントの評価手法に関する課題と、情報理論に基づいた新しい評価アプローチ「Discovery Bench」を紹介します。従来の固定ベンチマークではエージェントの能力を正確に把握できず、曖昧さが増すと機能しなくなる「崖」や、最適な性能を発揮する「スイートスポット」を見落とす可能性があります。Discovery Benchは、クエリの曖昧さを情報理論的に調整することで、エージェントの能力をより詳細に可視化し、評価ツールの信頼性も検証します。 この記事は、AIエージェントの評価手法に課題を感じているエンジニア、データサイエンティスト、テックリード、およびAIシステムの開発・評価に携わるすべての人々を対象としています。 AIエージェントの能力を正確に測定するための新しい評価手法「Discovery Bench」について解説し、従来の評価方法の限界と、情報理論を用いた曖昧性調整による詳細な分析の重要性を強調します。

グーグル・クラウド・ジャパン合同会社<name>Sunil Pedapudi</name><title>Technical Lead, Data Cloud Frontier AI</title><department></department><company></company>
QA・テスト

Synthetics (Scripted Browser) で Passkey(パスキー)認証が必要なサイトを監視する方法

newrelic.com

- Synthetics (Scripted Browser) を使用して、パスキー認証を導入したサイトのログイン監視が可能になった。 - 最新の Scripted Browser ランタイムを利用することで、パスワードレスログインの監視に対応できる。 - パスキー認証が必要なウェブサイトの具体的な監視実装方法について解説する記事。

QA・テスト

QAと開発の両側から進める AI活用 -QAプロセスAI支援ツールキットと Inner Loop / Outer Loopの取り組み-

speakerdeck.com

本記事では、QAプロセスにおけるAI支援ツールキットの活用と、Inner Loop/Outer Loopの取り組みについて、QAと開発の両面から解説しています。 AIを活用したQAプロセス効率化に関心のあるQAエンジニア、開発者、およびプロダクトマネージャー向けです。 AI技術をソフトウェア開発ライフサイクルに統合する方法についての洞察を提供します。

QA・テスト

【実話】ローカルでは毎回パスするが、CIでは毎回落ちるテストの原因は○○だった

qiita.com

ローカル環境ではパスするのに、CI環境でだけテストが失敗する現象の原因を、実体験を基に解説しています。 この問題は、環境差異(特にファイルシステムやタイムゾーン)に起因することが多く、デバッグの難しさに触れています。 ソフトウェア開発者、特にCI/CDパイプラインの構築やテスト自動化に携わるエンジニア向けです。

QA・テスト

PythonアプリのOTel計装でトランザクションにパスが表示されないときの対処法

newrelic.com

PythonアプリでOpenTelemetry(OTel)をNew Relicに連携した際、トランザクションがHTTPメソッド単位でしか表示されず、パスが表示されない問題の解決策について解説します。 バックエンドエンジニアやSRE、QAエンジニアが、OTelによるPythonアプリのパフォーマンス監視をより詳細に行うために役立つ情報です。

New Relic株式会社Naoaki Hashimoto
QA・テスト

Xcode CloudのCIを「数字で語れる」ようにした話 — ローカルで小さく始める計測基盤

zenn.dev

- Xcode CloudのCIにおける「体感」による問題(遅延やテスト失敗)を、数字で計測・改善する仕組みをローカルで小さく構築した事例。 - 立派な基盤を作らず、継続的な計測を可能にするための背景、設計、実装、運用について解説。 - iOSエンジニア、特にCI/CDのパフォーマンス改善や計測基盤の導入に関心のあるテックリードやアーキテクト向けの記事。

QA・テスト

AI時代のエンジニアリングマネージャーのあり方|外部品質編 〜品質の可視化を、現場と経営をつなぐ形にするまで〜

zenn.dev

AIによる開発速度向上と、それに伴う品質向上のアプローチについて、エンジニアリングマネージャーがAI時代にどのように変化すべきかを考察する記事です。 AIの進化を踏まえ、品質の可視化を現場と経営層の間で共有する重要性について論じます。 この記事は、エンジニアリングマネージャー、プロジェクトマネージャー、テックリード、品質管理担当者向けです。

QA・テスト

AIに「レビューして」はもう古い?「敵対的検証」のすすめ

zenn.dev

- AIへの指示方法が「レビューして」から「敵対的検証して」へと進化 - 敵対的検証は、課題を前提に反証を試み、判定と根拠まで提示させる手法 - この記事は、AIの能力を最大限に引き出し、より深い洞察を得たい開発者やプロダクトマネージャー向け

QA・テスト

Claude Codeのskillをskillでレビューする ― 静的チェック×LLMレビュー×git hooksの3層ゲート

zenn.dev

アルダグラムのQAチームでは、Claude Codeのskillを活用してテスト分析からテスト設計までのQAプロセスをAIエージェント「qa-orchestrator」として整備・共同運用しています。 これにより、QAプロセス全体をAIに任せることが可能になり、効率化と品質向上が期待できます。 この取り組みは、固定制インプロセスQAからの脱却を目指すものです。

QA・テスト

メール認証を用いたMFAログインをSyntheticsのScripted Browserで実装する方法

newrelic.com

・メール認証を用いた多要素認証(MFA)ログインを、New Relic SyntheticsのScripted Browserで自動化・監視する方法を解説します。 ・ワンタイムパスワード(OTP)をメールで受信するタイプのMFAログインに焦点を当てています。 ・セキュリティ強化の一環としてMFA導入を検討している、または既存のMFAログインの監視方法を探しているエンジニアや運用担当者向けの記事です。

QA・テスト

AIレビューはどこまで任せられるのか?自動化と人が背負うレビューの境界

speakerdeck.com

AIコードレビューツールの活用と、自動化と人間のレビュー担当者の役割分担について解説するイベント。 ・AIにコードレビューをどこまで任せられるか、その境界線を探る。 ・AIコードレビューツールの選択肢と実践的な使い方を学ぶ。 ・ソフトウェア開発における自動化と人的レビューのバランスについて考察する。

QA・テスト

Tips: Open Code ReviewをGitHub Actions上で実行する際、severity high以上のもののみを指摘させるようにする

qiita.com

この記事は、Alibaba製のAIコードレビューOSS「Open Code Review」をGitHub Actions上で利用する際のTipsを紹介しています。 具体的には、コードレビューで検出される指摘のうち、重要度(severity)がhigh以上のものだけを通知・指摘させる方法について解説しています。 対象読者は、CI/CDパイプラインでコードレビューを自動化したいバックエンドエンジニアや、コード品質の向上に関心のある開発者です。

QA・テスト

Tiptap の自動テストがたまに落ちる?原因を調査するとイベントループに行き着いた

zenn.dev

Tiptapというリッチテキストエディタライブラリの自動テストが不安定になる原因を調査した記事です。ProseMirrorのイベントループの挙動が原因で、特定条件下でテストが失敗することが判明しました。 - フロントエンドエンジニア - QAエンジニア - テスト自動化に携わるエンジニア

QA・テスト

Vitestで始めるシンプルなVRT

zenn.dev

Vitest 4.0で追加されたVisual Regression Testing(VRT)のサポートを活用し、GitHub Actionsと組み合わせてシンプルなVRTを導入する方法を紹介します。 実際のプロダクトへの導入事例として、Vitest(Browser Mode)でのVRT実装について解説しています。 フロントエンドエンジニア、QAエンジニア、およびテスト自動化に関心のある開発者向けの記事です。

QA・テスト

固定制インプロセスQAからプール制へ——QA体制を再設計した話

zenn.dev

- アルダグラムのQAユニットが、固定制インプロセスQAからプール制へQA体制を再設計した経緯と運用について解説しています。 - プロダクトの成長と開発組織の拡大に伴う課題を解決するため、QA体制の移行を決断しました。 - QAエンジニア、開発組織のマネージャー、プロダクトマネージャーが対象です。